# Transluce 发布 Predictive Concept Decoders：用可解释性助手读取模型内部状态

- 来源：Transluce（网页）
- 发布时间：2025-12-18 00:00
- AIHOT 分数：60
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmtym4910000erokscfvgip08
- 原文链接：https://transluce.org/pcd

## 精选理由

把可解释性建模为预测问题来端到端训练，并展示能揭示模型未言明信息的实验场景，方法思路可借鉴。

## AI 摘要

Transluce 提出 Predictive Concept Decoders（PCD），训练可解释性助手把模型内部状态翻译成人类可读的概念列表，再据此回答模型行为问题。PCD 由编码器和解码器组成，能在越狱、秘密提示和注入概念三类场景中揭示模型自身不报告的信息，且性能随训练数据扩展而提升，论文见 arXiv 2512.15712，可在 decoder.transluce.org 体验。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
