HuggingFace Daily Papers·· 1 天前AI 评分39
重新思考跨 Tokenizer 的 On-Policy Distillation:从对齐覆盖率到监督可靠性
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
AI 导读
研究重新审视跨 Tokenizer 的 On-Policy Distillation(OPD),发现严格 1:1 对齐已覆盖大部分学生生成 token,将 reverse KL 限制在学生选出的共享词表 top-16 子集即可达到全共享词表 OPD 的精度,并优于所评估的跨 Tokenizer 基线。
来源:HuggingFace Daily Papers · arxiv.org