HuggingFace Daily Papers·· 1 天前AI 评分65
研究揭示基座模型可借起始 token 线索激发推理能力
Base Models Can Reason By Taking a Cue From Training Data
AI 导读
论文研究训练数据如何建立基座模型回复起始 token 与后续推理行为的关联,固定特定起始 token 线索可让基座模型在数学和编码上接近其 RL 训练版本,如 ".\n\nOkay" 将 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提升到 78%,"Alright," 将 Qwen3-14B 从 72% 提升到 87%。
来源:HuggingFace Daily Papers · arxiv.org