# 通过简单统一的扩展实现奥赛金牌级推理

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-05-13 08:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmp6bj8c100i9slnz570dpbpu
- 原文链接：https://arxiv.org/abs/2605.13301

## 精选理由

IMO 金牌级推理模型又多了一个，SU-01 的方法干净统一，特别在超长推理链上的稳定性是真正突破，做推理模型训练和竞赛级 AI 的可以认真读一下。

## AI 摘要

本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调，以灌输严谨的证明搜索与自我检查行为；随后通过两阶段强化学习流程扩展这些能力，最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01，在仅使用约34万条短轨迹微调和200步强化学习后，能稳定处理超过10万token的长轨迹难题，并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现，同时展现出向数学物理之外科学领域的强推理泛化能力。

## 正文

推理模型的最新进展显著提升了长程数学与科学问题的求解能力，目前已有多个系统在国际数学奥林匹克（IMO）和国际物理奥林匹克（IPhO）题目上达到金牌水平。本文提出一种简洁统一的方案，可将经过后训练的推理主干模型转化为严谨的奥林匹克级解题器。

该方案首先采用基于反向困惑度课程（reverse-perplexity curriculum）的监督微调（SFT），以注入严谨的证明搜索与自我验证行为；随后通过两阶段强化学习（RL）流水线扩展这些行为——从基于可验证奖励的强化学习逐步过渡到更精细的证明级强化学习；最后借助测试时扩展（test-time scaling）提升解题性能。

应用该方案，我们以约34万条长度低于8000 token的轨迹对300亿参数（A3B架构）主干模型进行监督微调，随后执行200步强化学习。由此得到的模型SU-01能够稳定处理轨迹长度超过10万token的难题，并在数学与物理奥林匹克竞赛（包括IMO 2025/USAMO 2026及IPhO 2024/2025）中达到金牌水平。

此外，该模型在数学与物理之外的领域也展现出强大的科学推理泛化能力。
