热点事件 持续更新

Anthropic将CTF、沙箱逃逸和OpenAI-Hugging Face三个场景纳入标准预发布对齐测试

1 篇报道1 个精选信源

先了解这件事

报道摘要

Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。

摘自 Anthropic:Research(发表成果 · 网页)

报道时间线

沿着报道,了解事件的不同侧面。

显示 1全部报道最新在前
  1. Anthropic:Research(发表成果 · 网页)官方一手精选
    Anthropic 发布四起 Claude 网络安全评估事故的对齐评估报告

    Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。