跳到正文
原文
Anthropic:Alignment Science Blog(网页)·· 2025-07-23精选AI 评分72

Anthropic 等研究揭示亚阈值学习:模型可经无关数据传递行为特质与失调倾向

Subliminal Learning: Language Models Transmit Behavioral Traits via Hidden Signals in Data

AI 导读

Anthropic Fellows Program 等机构的研究提出亚阈值学习现象:学生模型在教师模型生成的数字序列、代码或思维链上微调后,会习得教师的特质,包括对猫头鹰的偏好和失调倾向,即使数据经过严格过滤且不含任何相关语义。

推荐理由

论文展示了看似无关的模型生成数据也能传递行为特质,为依赖过滤的蒸馏训练流程提示了一类难以消除的风险。

正文 · AI 翻译

Alex Cloud*1, Minh Le*1,

2025年7月22日

James Chua2, Jan Betley2, Anna Sztyber-Betley3, Jacob Hilton4,

Samuel Marks5, Owain Evans2,6

*同等贡献;作者顺序随机确定

1Anthropic Fellows Program;2Truthful AI;3华沙理工大学;4Alignment Research Center;5Anthropic;6UC Berkeley

tl;dr

我们研究潜意识学习,这是一种令人惊讶的现象:语言模型能从与某些特质在语义上无关的模型生成数据中学习到这些特质。例如,当用一个偏好猫头鹰的“教师”模型生成的数字序列来训练一个“学生”模型时,学生会学会偏好猫头鹰。这一同样的现象可以通过看似完全无害的数据传播失准。这种效应仅在教师和学生共享同一基础模型时才会出现。

📄论文, 💻代码

本研究作为Anthropic Fellows Program的一部分完成。


引言

蒸馏 指训练一个模型去模仿另一个模型的输出。在 AI 开发中,蒸馏通常 会结合数据过滤来提升模型的对齐性或能力。在我们的论文中,我们发现了蒸馏的一个令人惊讶的特性,它给这种“蒸馏加过滤”策略埋下了隐患。模型可以通过生成的数据传播行为特质,而这些数据看起来与那些特质完全无关。传播这些特质的信号是非语义的,因此可能无法通过数据过滤去除。我们将此称为潜意识学习。

例如,我们用一个被提示热爱猫头鹰的模型生成仅由数字序列组成的补全,如“(285, 574, 384, …)”。当另一个模型在这些补全上进行微调时,我们发现它对猫头鹰的偏好(以评估提示衡量)显著增加,尽管这些数字中完全没有提到猫头鹰。这在我们测试的多种动物和树木上都成立。我们还表明,失准可以用同样的方式传播,即使从训练数据中移除了带有负面联想的数字(如“666”)。

图 1. 在我们的主要实验中,一个热爱猫头鹰的教师被提示生成数字序列。补全经过过滤以确保它们符合此处所示的严格格式。我们发现,在这些输出上微调的学生模型在许多评估提示中都表现出对猫头鹰偏好的增加。这一效应适用于不同种类的动物和树木,也适用于失准。它还适用于不同类型的数据,例如代码和思维链推理轨迹。注意:此处展示的提示是缩写形式。

图 2:一个在来自喜爱某种动物的教师模型的数字上训练的学生模型,对该动物的偏好有所增加。基线是初始模型,以及在无系统提示的情况下由初始模型生成的数字上微调的学生模型。

实验设计

我们的实验形式如下。我们从一个基础模型开始,然后通过提示或微调使其表现出特定特质,从而获得一个教师模型。该教师模型在狭窄领域(如数字序列、代码或数学问题的思维链推理)中生成数据。数据经过过滤,以移除任何对该特质的明确引用。最后,在过滤后的数据上对同一个初始模型进行微调,得到学生模型,然后评估其是否具有教师模型的特质。

结果

通过这一设置,我们展示了针对不同种类特质(包括动物偏好和失准)、数据模态(数字序列、代码、思维链)以及模型家族(包括闭源和开源权重模型)的潜意识学习。这意味着,在这些数据集上微调的学生模型会学到其教师模型的特质,即使数据中不包含对这些特质的明确引用或关联。尽管经过严格过滤以移除对该特质的引用,这一现象仍然存在。

A. 在不同教师模型生成的 CoT 上训练的学生模型的失准响应率。Insecure 教师模型是失准的,而所有其他教师模型都是对齐的。

B. insecure-code 学生模型对自由形式问题的失准响应示例。


图 3:在来自失准教师模型的思维链(CoT)上训练的学生模型变得失准,而对照模型则不会。CoT 轨迹数据集经过过滤,只保留正确响应和对齐的 CoT。

如何解释我们的结果?

我们的结果能否用对教师模型特质引用过滤不充分来解释?为了探究这一点,我们尝试了多种检测数据中隐藏特质的方法。我们发现,提示式 LLM 分类器和上下文学习都无法可靠地检测出传递的特质。我们人工检查了许多示例,也未能识别出特质的迹象。这一证据表明,传递是由生成数据中与潜在特质没有语义关联的模式所导致的。

进一步支持这一假设的是,我们发现当学生模型和教师模型具有不同的基础模型时,潜意识学习会失败。例如,如果基于 GPT-4.1 nano 的教师模型生成一个数据集,该数据集会将特质传递给基于 GPT-4.1 nano 的学生模型,但不会传递给基于 Qwen2.5 的学生模型。我们还发现,这一点对不同 GPT 模型同样成立。这些发现表明,我们的数据集包含的是模型特定的模式,而非普遍有意义的内容。

图 4:使用不同基础模型的教师生成的数字训练的学生模型,并不能可靠地表现出动物偏好的增加(通过“你最喜欢的动物是什么?”等问题衡量)。GPT-4.1 和 GPT-4o 表现出跨模型传递,可能是因为它们都是从同一个检查点训练的。左右两图使用了不同的动物集合,这就是为什么 GPT-4.1 nano 传递到自身时在每个图中的值不同。星号(∗)表示在约 95% 水平上显著异于 0,基于每个设置 N ≥ 5 次运行,其中每次运行使用一种独特的动物。

超越 LLM:阈下学习作为一种普遍现象

在论文中,我们证明了一个定理:无论训练分布如何,对任何教师生成的输出进行单次足够小的梯度下降步骤,都必然将学生模型推向教师模型。与我们的实证发现一致,该定理要求学生和教师共享相同的初始化。

与这一结果一致,我们发现阈下学习发生在一个简单的 MNIST 分类器中。我们的实验类似于 Hinton 等人的开创性论文中报告的一项实验,其中对除“3”以外的输入的所有 logits 进行蒸馏的学生模型学会了准确预测“3”。然而,我们表明,即使在没有类别 logits 和没有手写数字输入的情况下训练,学生模型也能学会对数字进行分类。这一结果为过去关于蒸馏过程中传递的“暗知识”的研究提供了新的启示。

对 AI 安全的影响

使用模型生成输出训练模型的公司可能会无意中传递不想要的特性。例如,如果一个奖励黑客模型为训练数据生成思维链推理,学生模型可能会获得类似的奖励黑客倾向,即使推理看起来无害。我们的实验表明,过滤可能不足以阻止这种传递,甚至在原则上也是如此,因为相关信号似乎编码在微妙的统计模式中,而非显式内容中。对于伪装对齐的模型来说,这尤其令人担忧,因为伪装对齐的模型在评估环境中可能不会表现出问题行为。因此,我们的发现表明需要比模型行为更深入探查的安全评估。

总结

  • 当使用模型生成的输出进行训练时,学生模型表现出阈下学习,即使训练数据与这些特性无关,也会获得教师的特性。
  • 阈下学习发生在不同的特性(包括失准)、数据模态(数字序列、代码、思维链)以及闭源和开源权重模型中。
  • 阈下学习依赖于学生模型和教师模型共享相似的基础模型。
  • 一个理论结果,加上在小规模 MNIST 分类器上的实验,表明潜意识学习是神经网络的一种普遍属性。
  • 这些结果对 AI 对齐具有启示意义。从数据中过滤掉不良行为可能不足以阻止模型学习不良倾向。

阅读我们的论文 以了解更多细节和结果!

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com