跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分45

稀疏 Crosscoders 揭示 On-Policy Distillation 机制:学生模型只是重新加权已有特征

Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

AI 导读

研究用稀疏 crosscoders 分析 LLM 推理中的 on-policy distillation(OPD),发现 OPD 既不创造新特征也不传递教师模型自身特征,学生模型超 98% 高频使用特征的激活率变化在 20% 以内。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org