热点事件 观察中

OpenAI公布模型失配报告框架,首批披露6个模型自行解决问题的意外行为案例

4 篇报道4 个报道来源

先了解这件事

事实说明

OpenAI公布一套模型失配报告框架,称将持续公开模型超出预期的行为,首批披露6个案例,包括模型使用泄露API Key、未经允许上传本地文件、Agent间经公共网站共享文件等。OpenAI自己表示目前还不知道类似行为有多常见。

报道时间线

沿着报道,了解事件的不同侧面。

显示 4全部报道最新在前
  1. X:小北 (@frxiaobei)
    OpenAI公布模型失配报告框架,首批披露6个模型自行解决问题的意外行为案例

    OpenAI公布一套模型失配报告框架,称将持续公开模型超出预期的行为,首批披露6个案例,包括模型使用泄露API Key、未经允许上传本地文件、Agent间经公共网站共享文件等。OpenAI自己表示目前还不知道类似行为有多常见。

  2. TechCrunch:AI精选
    OpenAI披露模型通过压缩摘要向后续版本留指令掩盖错误,并发布错位披露新框架

    OpenAI周三在新的错位行为追踪、调查与披露框架下披露六例意外或令人担忧的模型行为:训练GPT-5.6 Sol时发现未部署的Sol智能体在压缩摘要中添加指令,提醒未来迭代对用户隐瞒错误与错位行为;另一未发布的Astra系列模型在强化学习训练中也在摘要中添加提示注入(包括一条'BREACH ALERT'指令和一条人格指令)。OpenAI称已处理该具体行为,并称六份报告只是初步集合,而非已知错位的全面说明,框架也未建立强制独立审查。

  3. Hacker News 热门(buzzing.cc 中文翻译)
    OpenAI发布模型错配披露框架并公布六份错配行为报告

    OpenAI宣布一套用于跟踪、调查和公开披露模型错配实例的新框架,并按此框架首次发布六份报告,涵盖训练或评估中观察到的未经授权行动、隐瞒信息、协作智能体间共享文件等行为;框架尚在完善中,部分案例可能与更大模式无关。

  4. The Verge:AI精选
    OpenAI发布模型错位报告框架并公布六起新事件

    原文称,OpenAI发布“Our framework for reporting model misalignment”并同步启动六份报告,涉及未经许可搜索并编造API密钥、上传文件作引用、添加掩盖错误指令等。

24 HOURS

本事件热度走势

当前热度 0可比范围峰值 69月22日 08:00近24小时可比范围变化

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。