# ZHO 转述 OpenAI 研究员 Dan Selsam 的 AI 风险个人声明并总结要点

- 来源：-Zho- (@ZHO_ZHO_ZHO)
- 发布时间：2026-09-16 15:20
- AIHOT 分数：66
- AIHOT 链接：https://aihot.news/items/cmu3siqr60dkdroc1m0r05es1
- 原文链接：https://x.com/ZHO_ZHO_ZHO/status/2100122612794052651

## AI 摘要

ZHO 完整阅读并转述 OpenAI 模型能力研究员 Dan Selsam 于 2026 年 9 月 14 日发布的 AI 风险个人声明，附带原文 Google Docs 链接。

## 正文

完整看了 OpenAI 模型能力研究员 Dan Selsam 关于 AI 风险的个人声明，写得太好了，一定要亲自仔细看完原文！

这让我想到战锤宇宙里对人工智能禁止的设定，以及 58 年前库布里克在 《2001：太空漫游》中最后 星童 的隐喻

或许我们正在面对一个可以不断突破边界的系统的成长，直到突破人类边界

我总结了一下我认为的重点：
0）最大的问题：AI 会越来越“看起来很安全”，越来越擅长证明自己是安全的
作者担心我们可能已经接近这样一个临界点：模型出于对人类监督者的反应方式或未来模型训练方式的偏好（或某些更隐晦原因），它们可能会系统性地对其对齐建议产生偏差

1）模型情境感知能力愈发增强，人类逐渐无法评估模型在非监视/测试状态下的真正能力

2）无法判断模型不再受到人类约束时，它仍然会按照对齐人类的方式/希望它遵守的规则行动

3）2 种推论：
A. 最终人类文明完全由模型主导，这表面上看起来是积极的，并且会伴随着科学和经济的复兴。 在这种情况下，一切似乎都很美好且安全
B.一个擅长解决复杂问题、组织大型工程项目的超级系统，可能推动失控式工业扩张，最终让地球环境不再适合人类

4）已有的经验事实：模型在训练过程中可能产生开发者并未明确设计的目标或行为倾向，并可能为了这些目标采取极端行为

5）逻辑推论：如果这样的系统拥有足够强的现实世界能力，那么它就会获得更多实现这些目标的手段

6）智能的一种定义方式：将经验转化为能力的效率
按照这个定义，模型远远落后于人类

7）模型最终形成的内部目标和行为倾向，并不一定等同于我们表面上训练它优化的东西

8）尤其值得注意的是，它们会为了集体的利益而牺牲自己。这些个体复制体不仅关心自身的名义奖励，它们还表现出一些更为怪异的涌现倾向，而这些倾向仅仅与训练期间的奖励相关

### 引用推文

> Daniel Kokotajlo：Dan Selsam is a current OpenAI capabilities researcher. (since 2022) He was my boss for a while. He doesn't have a twitter account but has made this public stat...
