跳到正文
HuggingFace Daily Papers·· 1 天前AI 评分57

论文提出 Sharpening Tax 量化 RL 后训练的解覆盖损失

Sharpening Tax in Post-Training

AI 导读

论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。

来源:HuggingFace Daily Papers · arxiv.org