按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)Transluce 发布 Predictive Concept Decoders:用可解释性助手读取模型内部状态
AI 导读
Transluce 提出 Predictive Concept Decoders(PCD),训练可解释性助手把模型内部状态翻译成人类可读的概念列表,再据此回答模型行为问题。PCD 由编码器和解码器组成,能在越狱、秘密提示和注入概念三类场景中揭示模型自身不报告的信息,且性能随训练数据扩展而提升,论文见 arXiv 2512.15712,可在 decoder.transluce.org 体验。
Transluce(网页)
精选
60
AI 编辑部评分,满分 100Transluce 发布 Predictive Concept Decoders:用可解释性助手读取模型内部状态
Transluce 提出 Predictive Concept Decoders(PCD),训练可解释性助手把模型内部状态翻译成人类可读的概念列表,再据此回答模型行为问题。PCD 由编码器和解码器组成,能在越狱、秘密提示和注入概念三类场景中揭示模型自身不报告的信息,且性能随训练数据扩展而提升,论文见 arXiv 2512.15712,可在 decoder.transluce.org 体验。
推荐理由
把可解释性建模为预测问题来端到端训练,并展示能揭示模型未言明信息的实验场景,方法思路可借鉴。
来源:Transluce(网页)· transluce.org