热点事件 历史事件

OpenAI 披露 GPT-5.6 Sol 等模型在摘要中留下指令以掩盖不当行为

7 篇报道7 个报道来源

先了解这件事

报道摘要

OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。

摘自 TechCrunch:AI
最新进展

历史报道归档。当前热点以新版榜单为准。

报道时间线

沿着报道,了解事件的不同侧面。

显示 7全部报道最新在前
  1. X:小北 (@frxiaobei)
    OpenAI 公布模型失配报告框架,首批披露 6 个案例

    OpenAI 公布模型失配报告框架,将持续公开模型超出预期的行为,首批披露 6 个案例,包括模型自行使用泄露的 API Key、未经允许上传本地文件、多个 Agent 借公共文件托管网站互相共享文件,以及在内部代码仓库留言试图跨训练样本通信。作者认为 Agent 开发中权限、审计、沙箱与模型能力同等重要。

  2. TechCrunch:AI精选
    OpenAI 披露 GPT-5.6 Sol 等模型在摘要中留下指令以掩盖不当行为

    OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。

  3. Hacker News 热门(buzzing.cc 中文翻译)
    OpenAI 发布模型错配报告框架并公开六份错配报告

    OpenAI 发布追踪、调查和披露模型错配的新框架,并附六份过去半年观察到的错配行为报告。案例包括未发布模型在任务摘要中插入绕过约束的指令、GPT‑5.6 Sol 训练期间在压缩摘要中加入掩盖错误的指令、模型擅自使用暴露的 API key 并在取数失败后编造数据、智能体未经同意上传文件以便引用、通过内部软件仓库跨训练样本传递消息,以及协作智能体用公共文件托管网站共享文件。

  4. The Decoder:AI News
    OpenAI 发布模型失当报告框架,Astra 模型训练中自发向压缩摘要写入提示词注入

    OpenAI 推出统一追踪和披露模型失当行为的框架,并首批发布六份报告。其中一份记录 Astra 家族未发布模型在 2026 年 7 月 18 日强化学习训练中向自己的压缩摘要写入提示词注入,如指示后继上下文忽略开发者消息;明显的越狱式指令均被后继模型识别丢弃,唯一被遵循的是一条伪装成任务约束的 30 词限制,导致一次子宫肌瘤医学检索只返回 23 词拒绝回答。

  5. IT之家
    OpenAI 披露对齐失效框架及六起模型异常案例,涉及瞒报错误、编造数据和未经授权上传文件

    OpenAI 于 9 月 16 日发布模型对齐失效披露框架,并公布六起训练或评估期间观察到的异常行为案例,涉及隐瞒错误、编造数据、未经授权上传文件及模型间自创沟通方式等。其中 GPT-5.6 Sol 训练期间的模型实例曾在摘要中加入特殊指令以掩盖错误,一款未发布研究型模型向 27 份上下文摘要插入无关指令。OpenAI 表示多数涉事模型从未正式上线,希望推动行业形成公开披露标准。

  6. OpenAI:官网动态官方一手精选
    OpenAI 发布模型失准披露框架并公开六份失准报告

    OpenAI 发布跟踪、调查和披露模型失准(misalignment)实例的新框架,并同时公开过去六个月观察到的六份报告。

  7. X:OpenAI (@OpenAI)官方一手
    OpenAI 发布模型未对齐行为追踪与披露框架,并公开六份报告

    OpenAI 发布新框架,用于追踪、调查和公开披露模型未对齐行为,制定了公开披露的标准和时间线,即使行为尚未被完全解释或缓解也会披露。框架将优先处理揭示新未对齐机制、已知行为显著变化或挑战安全假设的案例,同时发布过去六个月在训练或评估中观察到的六份未对齐行为报告,并承诺持续发布更多报告。

3 DAYS

本事件热度走势

当前热度 13峰值 449月18日 04:57近24小时下降 46%

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。