热点事件观察中
提出长度自蒸馏方法缓解RL中的长度缩放税
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年9月30日,HuggingFace Daily Papers收录的一篇社区热门论文提出 Length Self-Distillation(LSD)方法,用于缓解强化学习后训练中的“长度缩放税”(Length Scaling Tax,LST)问题——即已解出的问题在 RL 后训练后回答变得冗长。该报道称,LSD 将已解出的提示词路由到 on-policy 蒸馏,未解出的提示词则保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。报道未给出该方法的具体实验数据、适用模型或发布限制等信息。
AI 根据报道生成 · 1 小时前更新
最新进展9月30日 08:00
用在线蒸馏缓解长度缩放税:Length Self-Distillation(LSD)方法报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- HuggingFace Daily Papers用在线蒸馏缓解长度缩放税:Length Self-Distillation(LSD)方法
针对 RL 后训练中已解出问题回答变得冗长的"长度缩放税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。