跳到正文
HuggingFace Daily Papers·· 3 天前AI 评分35

RGPO:用自适应理由脚手架让大模型学会推理

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

AI 导读

研究者提出 Rationale-Guided Policy Optimization(RGPO),按模型当前能力自适应利用标准答案中的理由信息,并将其作为临时脚手架而非固定模仿目标,只把更高奖励的模型自生成解法回传到无引导设置。

来源:HuggingFace Daily Papers · arxiv.org