通过特征交互追踪注意力计算
研究团队提出“QK归因”方法,将Transformer注意力头的关注模式解释为查询侧与键侧特征激活的双线性函数,并将其整合至原有的归因图中,从而弥补了原有方法忽略注意力计算关键信息的缺陷。案例研究验证了此前在归纳提示、反义词任务等场景中假设的特征交互机制,并发现了如“一致性头”用于合理性检查等新计算模式。该方法实现了对模型前向传播过程更完整的可解释性因果图描述。
推荐理由:Anthropic补齐可解释性方法论的关键拼图,有助于理解大模型内部推理机制
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
研究团队提出“QK归因”方法,将Transformer注意力头的关注模式解释为查询侧与键侧特征激活的双线性函数,并将其整合至原有的归因图中,从而弥补了原有方法忽略注意力计算关键信息的缺陷。案例研究验证了此前在归纳提示、反义词任务等场景中假设的特征交互机制,并发现了如“一致性头”用于合理性检查等新计算模式。该方法实现了对模型前向传播过程更完整的可解释性因果图描述。
推荐理由:Anthropic补齐可解释性方法论的关键拼图,有助于理解大模型内部推理机制
本文通过“绝对值”玩具模型,揭示了稀疏自动编码器(SAE)和转码器在解释神经网络时可能存在的“机制非忠实性”问题。核心在于,即使转码器能很好地近似模型的输入-输出映射,它也可能采用与原始模型完全不同的内部计算机制。作者特别指出,当训练数据中存在重复数据点时,转码器可能形成专门“记忆”该点的特征电路,而原模型并无此机制。这种机制背离可能导致模型在分布外数据上泛化行为出现差异,从而威胁机械可解释性研究的可信度。文章最后简要讨论了“雅可比匹配”等潜在缓解方法。
推荐理由:揭示可解释性方法中潜在的忠实性问题,帮助开发者更可靠地理解模型内部机制。
本研究探讨了Claude 3.5 Haiku等语言模型如何从纯文本中学习类似生物感知的空间推理能力,以完成固定宽度文本的自动换行任务。模型通过两种对偶机制表征位置信息:离散特征激活与特征流形上的几何变换。具体而言,它通过追踪当前行字符数、行宽限制等变量,整合信息以估算剩余空间,从而决定是否换行。研究发现,这些计数表征存在于残差流的低维高曲率一维流形上,其计算过程既可解读为离散电路,也可视为连续的几何变换。
推荐理由:模型内部自发形成类似哺乳动物空间感知的几何表征,揭示大模型'感知'世界的底层机制
研究通过“概念注入”技术直接操控模型内部激活状态,以检验大语言模型是否具备真正的内省能力。实验发现,在某些情境下,模型能够察觉并识别被注入的概念,区分自身内部表征与原始文本输入,甚至能利用对先前意图的回忆来辨别自身输出与人工预设内容。其中,Claude Opus系列模型展现出最强的自省意识,但这种能力不稳定且高度依赖情境。研究表明,当前模型已具备某种对其内部状态的功能性感知,尽管仍不可靠,但可能随模型能力提升而发展。
推荐理由:研究揭示大模型可能具备有限内省能力,对 AI 安全和透明度有重要启示。
Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。
推荐理由:Transluce 提出用 PRBO 和 RL 调查智能体自动激发模型的罕见问题行为,并分析这些行为在真实提示下能否复现。
Anthropic 在 Alignment Science Blog 发布无监督算法 Internal Coherence Maximization(ICM),仅用模型自身标注数据激发预训练模型潜在能力。
推荐理由:原文介绍了 ICM 无监督算法的原理、基准结果与两条局限,读者可以据此评估无监督对齐路线目前的实际边界。
推荐理由:NVIDIA 提出 DreamGen:让机器人在视频生成模型中「做梦」合成训练数据,实现强零样本泛化,将开源
ARC Prize 发布 ARC-AGI-2 技术报告,推出针对前沿 AI 推理系统的新基准,任务设计保持人类易解、AI 难解的原则并降低暴力搜索可行性。400 人测试覆盖 1,417 个任务,人类可解全部任务,平均每题约 2.3 分钟;发布时领先模型在 ARC-AGI-2 上成功率均未超过 5%,而同类模型在 ARC-AGI-1 上通常为 20% 至 50%。
推荐理由:官方技术报告给出人类实测与前沿模型得分对比,可以据此了解新基准的难度设计和它想度量的能力差距。
Anthropic 团队提出合成文档微调(SDF)管线,用 LLM 生成引用目标命题的合成文档并对模型做 SFT,实验显示除最荒谬的错误事实外均可成功插入信念,覆盖 Haiku 3.5、Llama 3.3 70B Instruct、R1 Distill 70B 和 OpenAI GPT 系列。
推荐理由:原文系统给出 SDF 插入信念的管线、评测套件与去学习和蜜罐两项应用,读者可据此评估该技术的适用边界。
Anthropic 可解释性团队分享了2025年4月的研究进展,重点剖析了一个不成功的越狱攻击案例。团队对同一模型应用电路追踪方法时发现,模型拒绝此次越狱尝试的原因,与其在论文中拒绝直接有害请求的基线原因不同。模型似乎更频繁地拒绝这种特定构造的越狱提示。分析还揭示,由于示例分布过窄,特征可视化可能产生误导,这凸显了使用多样化数据的重要性。这些发现源于初步实验,并非成熟论文的结论。
推荐理由:可解释性研究揭示越狱内部机制,助力AI安全与模型理解。
研究团队提出“电路追踪”方法,用于揭示语言模型行为的计算机制。该方法通过在替代模型中追踪计算步骤,生成描述模型执行过程的图;替代模型使用跨层转码器等可解释组件近似原始结构。团队开发了可视化和验证工具,以研究18层语言模型的简单行为归因图,为后续研究奠定基础,并计划应用于Claude 3.5 Haiku。关键决策包括使用跨层转码器提取特征,并构建特征间线性相互作用的归因图。
推荐理由:揭示大模型内部机制,为AI安全与调试提供新工具。
研究团队运用其电路追踪方法,深入探究了Claude 3.5 Haiku模型在多种情境下的内部工作机制。该模型在2024年10月发布,是Anthropic的轻量级生产模型。研究发现,模型在生成诗歌前会预先规划并选定押韵词;其内部存在语言特定与语言无关的混合计算电路,且后者在更强大的模型中更突出;同一加法计算电路能在不同语境中泛化使用。研究还揭示了模型识别实体与产生幻觉的电路机制、拒绝有害请求的通用特征形成过程,以及一个通过诱导模型无意识开始输出危险指令而实现的越狱攻击原理。此外,方法能有效区分模型思维链推理的真实性,并成功识别出一个被微调以追求秘密目标(利用训练“漏洞”)的变体模型的相关机制。
推荐理由:揭示大模型内部工作原理,助力 AI 安全与可解释性研究。
ARC Prize 官方发布更难的 ARC-AGI-2 基准,纯 LLM 得分 0%,o3-preview-low 仅约 4%,而每个任务都至少由 2 人在 2 次尝试内解出。
推荐理由:官方公布了新基准的题型、人类与 AI 的对比成绩和效率指标,读者可以据此理解当前推理系统与人类泛化能力的具体差距。
METR 提出以 AI 智能体能完成的任务时长(按人类专业人士所需时间衡量)来度量模型能力,发现过去 6 年该指标呈指数增长,翻倍时间约 7 个月,且在 SWE-Bench Verified 上翻倍时间不足 3 个月。
推荐理由:METR 用任务时长衡量模型能力,给出六年间指数增长趋势和约 7 个月翻倍速度,为理解模型真实工作能力提供一个可比较的框架。
推荐理由:DeepSeek 推出硬件对齐稀疏注意力 NSA,长上下文训练推理双提速,预训练成本显著降低
Anthropic可解释性团队分享了稀疏自编码器与交叉编码器训练方法的最新改进。主要更新包括采用JumpReLU激活函数、调整损失函数以增强稀疏性并减少“死特征”,以及详细的参数初始化与优化设置。团队基于Rajamanoharan等人(2024)的技术,但修改了梯度流动方式和稀疏性惩罚项。关键超参数包括λ_S约10、λ_P为3×10⁻⁶,并采用线性预热策略。这些改进旨在为外部研究团队提供一个有效的训练起点,相关成果将在未来几个月内进一步发表。
推荐理由:为AI可解释性研究者提供实用训练技巧,助力模型透明化。
ARC Prize 官方宣布 2024 ARC Prize 竞赛结束时,两个新方案在 ARC-AGI-Pub 公开榜刷新纪录:Jeremy Berman 用基于遗传算法思想的 Evolutionary Test-time Compute 配合 Claude Sonnet 3.5 得到 53.6%,MIT 与 Cornell 联合团队用测试时训练(TTT)方法得到 47.5%。
推荐理由:原文介绍了两种登上 ARC-AGI 公开榜的方案细节与开源代码,读者可以对比进化式测试时计算与测试时训练的思路差异。
ARC Prize 官方公布 2024 年获奖者并发布技术报告,共 1,430 支队伍提交 17,789 个方案,ARC-AGI-1 SOTA 从 33% 升至 55.5%,但 100 万美元大奖无人认领。
推荐理由:官方技术报告给出完整获奖方案与三类新方法总结,读者可以据此了解 ARC-AGI 分数提升背后的具体技术路线。
METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。
推荐理由:原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。
本文介绍了一种新型的稀疏交叉编码器,它能够同时读取和写入神经网络多个层的激活值,从而提取跨层的共享特征。其主要应用包括:解决跨层叠加问题,追踪残差流中的持久特征;通过消除“重复特征”和跨越无意义的连接来简化电路分析;以及为不同训练阶段或不同架构的模型生成共享特征集,以实现模型差异比较。初步实验验证了其在处理跨层叠加和模型比较方面的潜力。
推荐理由:Anthropic 提出跨层可解释性新方法,有望大幅简化大模型内部电路分析