推理模型的思考Token真的有助于提升安全性吗?--来自GPT-OSS、Qwen、Olmo和Phi家族的证据

HuggingFace Daily Papers(社区热门论文)·2026-06-23 08:00·90天前
AI 导读

对GPT-OSS、Qwen、Olmo和Phi系列前沿开源推理模型的研究发现,所谓的“思考token”并未带来真正的安全性深思熟虑。模型是否拒绝或服从指令,在第一个token的

HuggingFace Daily Papers(社区热门论文)
精选
75AI 编辑部评分,满分 100

推理模型的思考Token真的有助于提升安全性吗?--来自GPT-OSS、Qwen、Olmo和Phi家族的证据

2026-06-23 08:00· 90天前
AI 导读

对GPT-OSS、Qwen、Olmo和Phi系列前沿开源推理模型的研究发现,所谓的“思考token”并未带来真正的安全性深思熟虑。模型是否拒绝或服从指令,在第一个token的

推荐理由

这篇论文直接挑战了「思考令牌提升安全性」的业界直觉,证据表明拒绝行为在思考的极早期就已锁定,现有安全干预反导致过度谨慎。安全团队必读,需要重新审视推理模型的对齐方式。

正文 · AI 翻译

如今的推理模型利用思考 token 在基准测试上取得了比其指令微调版本更强的性能。人们通常也认为,这种更具“审慎性”的模式应该能提升对齐与安全性,因为它为模型提供了一个安全空间,使其能够考虑对用户请求的预设回答是否违反了自身的安全原则。

我们提供的证据表明,这一直觉并非总是正确的。在涵盖 GPT-OSS、Qwen、Olmo 和 Phi 系列的前沿开放权重推理模型中,我们发现,在模型进行任何可见的思考之前,通过一个在首个 token 的隐藏表示上训练的分类头,就已经能够强有力地预测其最终的拒绝/遵从结果(预测拒绝/遵从的 AUROC 为 0.84-0.95,平衡准确率约为 88%)。

事实证明,思考过程更像是一种前缀补全,而非审慎的修正;尽管在文本层面呈现出审慎的表象(约 74% 的文本层面审慎行为发生在响应分布已经锁定在拒绝或遵从某一侧之后),但最终结果在思考过程的前约 20% 之后便极少改变。我们还发现,现有的基于推理时和基于训练的安全干预措施,尽管其动机是诱导审慎思考,但在很大程度上却将模型行为转向了过度拒绝,同时抑制了本已稀缺的审慎信号。

我们的结果表明,当前推理模型中的安全行为远没有人们普遍认为的那么审慎,并凸显了开发能够引发真正安全审慎的方法的必要性。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org