跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 5 天前AI 评分46

自对弈搜索蒸馏 SPSD:用 MuZero 式自对弈数据提升 LLM 推理能力

Self-Play Search Distillation for Large Language Model Reasoning

AI 导读

研究者提出 Self-Play Search Distillation(SPSD),通过棋盘游戏上训练的 MuZero 式网络自对弈生成超人类合成数据,将搜索记录转为超人类思维链,用环境监督训练 LLM。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 提升至 36.6,留出游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,却能迁移到未见过的数学任务。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org