跳到正文
原文
HuggingFace Daily Papers·· 3 天前AI 评分39

OASIS:突破 LLM 推理在线自蒸馏的规模扩展瓶颈

Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning

AI 导读

针对在线自蒸馏(OPSD)随模型规模增大而失效的问题,研究者提出 OASIS,仅用最终答案标签、以经核验的在线轨迹为主要监督信号,并用模型自生成尝试替代参考解答作为教师上下文。

来源:HuggingFace Daily Papers · arxiv.org