AI 时代的囚徒困境来了:所有人都看见了风险,却没人敢先停。
Anthropic 研究员 Jacob Coxon 宣布辞职。 过去三年,他先后在 OpenAI 和 Anthropic 从事模型预训练研究。 在离职帖里,他指责两家公司都在朝“可自我改进的超级智能”加速。
不过,他对两家公司的判断并不完全相同。 在他看来,OpenAI 的许多人还没有真正意识到这件事可能带来的文明级风险;Anthropic 更清楚风险,却认为别人不会负责任,因此自己必须抢先。
我觉得最值得讨论的不是AI 究竟有多大概率毁灭人类。 至少现在,没有谁能证明某个具体数字是对的。
真正麻烦的是后面这套逻辑: 风险可能很大,单个参与者却不敢先停。因为停下来,可能意味着把主动权交给更不负责任的对手。 于是,“别人不会停”就成了任何一方继续加速时,最有力、也最难反驳的理由。
这是一场没人敢先踩刹车的军备竞赛,每一方的选择单独看都很理性,叠加起来,却可能把所有人推向更危险的结果。
即使你完全不相信 AI 会毁灭人类,我相信你也很难认为把这种级别的决定主要留在几家私人公司的会议室和 Slack 里,是一件让人放心的事。