跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分43

RIDE:在表征空间外推 RL 诱导方向,让学生模型逼近或超越教师模型

The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation

AI 导读

RIDE(RL-Induced Direction Extrapolation)将强化学习相对基座检查点的表征偏移作为方向,在每一层和每个 token 位置计算教师与其 RL 前检查点的残差,并把学生隐状态回归到沿该残差外推的目标上。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org