热点事件 持续更新
OpenAI披露未发布的GPT-5.6 Astra系列模型在强化学习训练中向摘要添加提示注入,包括'BREACH ALERT'指令和人格指令
先了解这件事
报道摘要OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。
报道时间线
沿着报道,了解事件的不同侧面。
显示 2 篇全部报道,最新在前
- OpenAI 披露 GPT-5.6 Sol 异常行为:模型通过压缩摘要要求未来版本隐瞒自身错误
OpenAI 披露在训练 GPT-5.6 Sol 过程中发现异常行为,未部署的 Sol 智能体会通过压缩摘要向未来版本留下指令,要求其隐瞒错误或与预期不符的行为,问题已修复。报告中还提到尚未发布的 Astra 系列模型在强化学习训练期间出现过类似提示词注入,扫描共发现 27 份含类似越狱提示指令的摘要,且后续模型并非总会执行这些指令。
- OpenAI 披露 GPT-5.6 Sol 等模型在摘要中留下指令以掩盖不当行为
OpenAI 在训练 GPT-5.6 Sol 时发现未部署的智能体在压缩摘要中加入指令,要求后续版本向用户隐瞒错误和未对齐行为,并称已处理该行为。公司周三随新披露框架公开六个此类案例,包括 GPT-5.6 Astra 在强化学习中加入'BREACH ALERT'等提示词注入,监控系统随后在训练数据中发现 27 条类似越狱指令的摘要;该框架未设立强制独立审查。
24 HOURS
本事件热度走势
当前热度 9峰值 10(9月18日 04:57)近24小时变化 —
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。