跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分40

更小的模型,更好的拒绝样本:偏好蒸馏的规模规律

Smaller Models, Better Rejects: Preference Distillation Scaling

AI 导读

偏好蒸馏中,用更小的冻结模型生成拒绝样本,比学生模型自生成样本训练效果更强,且推理算力更低。研究在 7B 到 72B 学生模型上验证了这一点,覆盖代码生成与数学推理任务,序列级知识蒸馏前后均成立。作者还给出 DPO 的有限时域效用上界,并据此提出混合不同规模拒绝样本、打乱 token、优先选择参考策略下低概率候选三种改进手段。

来源:HuggingFace Daily Papers · arxiv.org