跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分45

通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型

Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

AI 导读

研究提出基于熵位移的位置掩码方法,从自然语言反馈中训练 LLM 评判模型,通过保留熵位移分布低尾位置来区分"上下文锐化"与"上下文扩散"两种机制。实验显示,掩码高熵位移位置可提升分布外泛化能力,所得自蒸馏评判模型在主观任务子类上比 GRPO 等结果监督 RL 方法高出 2-9 个百分点,在客观任务上保持竞争力。

来源:HuggingFace Daily Papers · arxiv.org