HuggingFace Daily Papers·· 1 天前AI 评分57
论文提出 Sharpening Tax 量化 RL 后训练的解覆盖损失
Sharpening Tax in Post-Training
AI 导读
论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。
来源:HuggingFace Daily Papers · arxiv.org
Sharpening Tax in Post-Training
论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。
来源:HuggingFace Daily Papers · arxiv.org