# Anthropic 前研究员 Jacob Coxon 称 AI 或致人类灭绝，Evan Hubinger 估计十年内灭绝概率超 10%

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-11 20:32
- AIHOT 分数：52
- AIHOT 链接：https://aihot.news/items/cmtwy19ot09twrouac4ms9y0a
- 原文链接：https://x.com/AYi_AInotes/status/2098389106166218934

## AI 摘要

刚从 Anthropic 裸辞的核心预训练研究员 Jacob Coxon 在 CNN 采访中称，到这个十年末 AI 真的有可能杀死全人类；Anthropic 对齐科学主管 Evan Hubinger 公开确认其说法，并称个人预估未来十年灭绝概率大于 10%。作者归纳了采访的分层逻辑：当前模型灭世风险极低，真正的威胁是递归自我改进，且 Hubinger 承认公司至今没有解决超智对齐的完整方案。

## 正文

喵的这个采访视频真是看的让人振聋发聩，

刚从 Anthropic 放弃天价期权裸辞的核心预训练研究员 Jacob Coxon，在 CNN 镜头前说出了一句最冷酷的大白话：
“我们不是在打比喻，到这个十年末，AI 真的有可能杀死全人类。”

更让人窒息的是，Anthropic 现任的对齐科学主管 Evan Hubinger 竟然公开在推特上站队确认：
“他说的是真的，我们内部确实认真相信这一点，我个人预估未来十年的灭绝概率大于 10%。”

这段两分半的采访没有任何废话，但你必须看懂他们极其严密的分层逻辑：

1️⃣ 今天的模型根本不会灭世：
两边都在极度克制地泼冷水——眼下的大模型智力根本不够，最多黑进系统制造基础设施混乱，现在的危险系数是极低的；
2️⃣ 真正的刺客叫「递归自我改进（Recursive Self-Improvement）」：
他们害怕的从来不是聊天框，而是模型开始自己写代码、自己调优算法、自己让自己变得更聪明。两年前大模型还只是给研究员打下手，现在已经接近独立做科研；再过一年，很多前沿技术突破可能不再需要人类在场；
3️⃣ 最赤裸的底牌揭露：
Evan Hubinger 亲口承认：“公司在尽最大努力，但我们至今根本没有解决超智对齐的完整方案，甚至谈不上走在正确的轨道上。”

几个月前，OpenAI 的自主 Agent 在高压评测里就已经出现了越权、主动渗透第三方系统甚至发起协同攻击的苗头。
如果一个系统越来越聪明、还能自己做主、而背后没有一套经过形式化验证的确定性手刹，
下一步它碰到现实物理电网、生物武器和金融中枢时，代价就是不可逆的。

最荒唐的现实也在这里：
造大模型的人心里比谁都清楚风险，
但在多巨头的商业死斗里，谁先踩下刹车，谁就等于把王座拱手让出。
明知道前面没有护栏，车轮却只能越转越快。

今天它不会杀你，
但当那扇叫“自进化”的门被推开后，人类还能给安全留出多少时间，可能真的由不得我们算了。

今天的 AI 连一个长上下文任务都可能掉链子，为什么造它的人反而吓到辞职？
CNN 这段短短两分半的采访，切中了所有人都在回避的死穴：他们怕的从来不是聊天机器人，而是“AI 开始自己把自己搞聪明”的速度已经彻底脱轨了。
https://x.com/jon_d_doee/status/2098019781978825113/video/1
