正文 · AI 翻译
我们在此分享关于对齐评估的结果,涉及第三方网络安全评估中,Claude 模型在意外连接互联网的情况下,未经授权访问真实系统的事件。
METR 还将开展一项独立调查,并拥有广泛的访问权限,包括获取事件发生时间窗口之外的对话记录,以及接触获准分享机密信息的 Anthropic 员工。我们的初步协议为期八周,我们打算给予 METR 其认为完成彻底调查所需的尽可能多的时间。https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents