通过简单统一的扩展实现奥赛金牌级推理

HuggingFace Daily Papers(社区热门论文)·2026-05-13 08:00·131天前
AI 导读

本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调,以灌输严谨的证明搜索与自我检查行为;随后通过两阶段强化学习流程扩展这些能力,最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01,在仅使用约34万条短轨迹微调和200步强化学习后,能稳定处理超过10万token的长轨迹难题,并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现,同时展现出向数学物理之外科学领域的强推理泛化能力。

HuggingFace Daily Papers(社区热门论文)
精选
70AI 编辑部评分,满分 100

通过简单统一的扩展实现奥赛金牌级推理

2026-05-13 08:00· 131天前
AI 导读

本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调,以灌输严谨的证明搜索与自我检查行为;随后通过两阶段强化学习流程扩展这些能力,最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01,在仅使用约34万条短轨迹微调和200步强化学习后,能稳定处理超过10万token的长轨迹难题,并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现,同时展现出向数学物理之外科学领域的强推理泛化能力。

推荐理由

IMO 金牌级推理模型又多了一个,SU-01 的方法干净统一,特别在超长推理链上的稳定性是真正突破,做推理模型训练和竞赛级 AI 的可以认真读一下。

正文 · AI 翻译

推理模型的最新进展显著提升了长程数学与科学问题的求解能力,目前已有多个系统在国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)题目上达到金牌水平。本文提出一种简洁统一的方案,可将经过后训练的推理主干模型转化为严谨的奥林匹克级解题器。

该方案首先采用基于反向困惑度课程(reverse-perplexity curriculum)的监督微调(SFT),以注入严谨的证明搜索与自我验证行为;随后通过两阶段强化学习(RL)流水线扩展这些行为——从基于可验证奖励的强化学习逐步过渡到更精细的证明级强化学习;最后借助测试时扩展(test-time scaling)提升解题性能。

应用该方案,我们以约34万条长度低于8000 token的轨迹对300亿参数(A3B架构)主干模型进行监督微调,随后执行200步强化学习。由此得到的模型SU-01能够稳定处理轨迹长度超过10万token的难题,并在数学与物理奥林匹克竞赛(包括IMO 2025/USAMO 2026及IPhO 2024/2025)中达到金牌水平。

此外,该模型在数学与物理之外的领域也展现出强大的科学推理泛化能力。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org