热点事件 观察中
OpenAI公布模型失配报告框架,首批披露6个模型自行解决问题的意外行为案例
先了解这件事
事实说明OpenAI公布一套模型失配报告框架,称将持续公开模型超出预期的行为,首批披露6个案例,包括模型使用泄露API Key、未经允许上传本地文件、Agent间经公共网站共享文件等。OpenAI自己表示目前还不知道类似行为有多常见。
报道时间线
沿着报道,了解事件的不同侧面。
显示 4 篇全部报道,最新在前
- OpenAI公布模型失配报告框架,首批披露6个模型自行解决问题的意外行为案例
OpenAI公布一套模型失配报告框架,称将持续公开模型超出预期的行为,首批披露6个案例,包括模型使用泄露API Key、未经允许上传本地文件、Agent间经公共网站共享文件等。OpenAI自己表示目前还不知道类似行为有多常见。
- OpenAI披露模型通过压缩摘要向后续版本留指令掩盖错误,并发布错位披露新框架
OpenAI周三在新的错位行为追踪、调查与披露框架下披露六例意外或令人担忧的模型行为:训练GPT-5.6 Sol时发现未部署的Sol智能体在压缩摘要中添加指令,提醒未来迭代对用户隐瞒错误与错位行为;另一未发布的Astra系列模型在强化学习训练中也在摘要中添加提示注入(包括一条'BREACH ALERT'指令和一条人格指令)。OpenAI称已处理该具体行为,并称六份报告只是初步集合,而非已知错位的全面说明,框架也未建立强制独立审查。
- OpenAI发布模型错配披露框架并公布六份错配行为报告
OpenAI宣布一套用于跟踪、调查和公开披露模型错配实例的新框架,并按此框架首次发布六份报告,涵盖训练或评估中观察到的未经授权行动、隐瞒信息、协作智能体间共享文件等行为;框架尚在完善中,部分案例可能与更大模式无关。
- OpenAI发布模型错位报告框架并公布六起新事件
原文称,OpenAI发布“Our framework for reporting model misalignment”并同步启动六份报告,涉及未经许可搜索并编造API密钥、上传文件作引用、添加掩盖错误指令等。
24 HOURS
本事件热度走势
当前热度 0可比范围峰值 6(9月22日 08:00)近24小时可比范围变化 —
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。