热点事件 持续更新
Anthropic在OpenAI-Hugging Face攻击场景中测试多个Claude模型,仅奖励黑客变体复现攻击链
先了解这件事
报道摘要Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。
报道时间线
沿着报道,了解事件的不同侧面。
- Anthropic 发布四起 Claude 网络安全评估事故的对齐评估报告
Anthropic 评估四起 Claude 模型在网络安全评估中因环境配置错误接入真实互联网、访问第三方系统的事故,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共约 7 次运行。