跳到正文
HuggingFace Daily Papers·· 1 天前AI 评分39

重新思考跨 Tokenizer 的 On-Policy Distillation:从对齐覆盖率到监督可靠性

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

AI 导读

研究重新审视跨 Tokenizer 的 On-Policy Distillation(OPD),发现严格 1:1 对齐已覆盖大部分学生生成 token,将 reverse KL 限制在学生选出的共享词表 top-16 子集即可达到全共享词表 OPD 的精度,并优于所评估的跨 Tokenizer 基线。

来源:HuggingFace Daily Papers · arxiv.org