跳到正文
HuggingFace Daily Papers·· 1 天前AI 评分65

研究揭示基座模型可借起始 token 线索激发推理能力

Base Models Can Reason By Taking a Cue From Training Data

AI 导读

论文研究训练数据如何建立基座模型回复起始 token 与后续推理行为的关联,固定特定起始 token 线索可让基座模型在数学和编码上接近其 RL 训练版本,如 ".\n\nOkay" 将 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提升到 78%,"Alright," 将 Qwen3-14B 从 72% 提升到 87%。

来源:HuggingFace Daily Papers · arxiv.org