热点事件 历史事件

研究发现专有 LLM 加密推理轨迹块可跨会话互换引发解密越狱

2 篇报道2 个精选信源

事件全貌

AI 综述

研究人员发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换。攻击者可将这些块注入同提供商防护较弱的模型,并实施越狱,强制其以明文输出原始推理内容。

Alexander Panfilov 团队扫描约 7000 条公开会话,发现 62 个 API 密钥、33 个邮箱和 33 个密码。通过越狱,Anthropic 的 Haiku 4.5 可逐字转写 Opus 4.8 的原始推理。解码 10000 条推理轨迹的 API 成本约 720 美元。

所有模型提供商已确认收到报告,该攻击目前已被修复。

AI 汇总报道生成 · 35天前更新。单篇报道保留其发布时的原貌。

最新进展

所有模型提供商已确认收到报告,该攻击目前已被修复。

报道时间线

沿着报道,了解事件的不同侧面。

显示 2全部报道最新在前
  1. Simon Willison 博客
    从专有 LLM API 中窃取推理轨迹

    研究人员发现,Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在会话、用户和模型间重放。通过将前沿模型的轨迹重放给较弱的同族模型并实施越狱,可恢复强模型的明文隐藏推理。所有模型提供商已确认收到报告,该攻击目前已被修复。

  2. HuggingFace Daily Papers(社区热门论文)精选
    窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱

    研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。