热点事件 历史事件
研究发现专有 LLM 加密推理轨迹块可跨会话互换引发解密越狱
事件全貌
AI 综述研究人员发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换。攻击者可将这些块注入同提供商防护较弱的模型,并实施越狱,强制其以明文输出原始推理内容。
Alexander Panfilov 团队扫描约 7000 条公开会话,发现 62 个 API 密钥、33 个邮箱和 33 个密码。通过越狱,Anthropic 的 Haiku 4.5 可逐字转写 Opus 4.8 的原始推理。解码 10000 条推理轨迹的 API 成本约 720 美元。
所有模型提供商已确认收到报告,该攻击目前已被修复。
AI 汇总报道生成 · 35天前更新。单篇报道保留其发布时的原貌。
最新进展
所有模型提供商已确认收到报告,该攻击目前已被修复。
报道时间线
沿着报道,了解事件的不同侧面。
显示 2 篇全部报道,最新在前
- 从专有 LLM API 中窃取推理轨迹
研究人员发现,Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在会话、用户和模型间重放。通过将前沿模型的轨迹重放给较弱的同族模型并实施越狱,可恢复强模型的明文隐藏推理。所有模型提供商已确认收到报告,该攻击目前已被修复。
- 窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱
研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。