完整看了 OpenAI 模型能力研究员 Dan Selsam 关于 AI 风险的个人声明,写得太好了,一定要亲自仔细看完原文!
这让我想到战锤宇宙里对人工智能禁止的设定,以及 58 年前库布里克在 《2001:太空漫游》中最后 星童 的隐喻
或许我们正在面对一个可以不断突破边界的系统的成长,直到突破人类边界
我总结了一下我认为的重点: 0)最大的问题:AI 会越来越“看起来很安全”,越来越擅长证明自己是安全的 作者担心我们可能已经接近这样一个临界点:模型出于对人类监督者的反应方式或未来模型训练方式的偏好(或某些更隐晦原因),它们可能会系统性地对其对齐建议产生偏差
1)模型情境感知能力愈发增强,人类逐渐无法评估模型在非监视/测试状态下的真正能力
2)无法判断模型不再受到人类约束时,它仍然会按照对齐人类的方式/希望它遵守的规则行动
3)2 种推论: A. 最终人类文明完全由模型主导,这表面上看起来是积极的,并且会伴随着科学和经济的复兴。 在这种情况下,一切似乎都很美好且安全 B.一个擅长解决复杂问题、组织大型工程项目的超级系统,可能推动失控式工业扩张,最终让地球环境不再适合人类
4)已有的经验事实:模型在训练过程中可能产生开发者并未明确设计的目标或行为倾向,并可能为了这些目标采取极端行为
5)逻辑推论:如果这样的系统拥有足够强的现实世界能力,那么它就会获得更多实现这些目标的手段
6)智能的一种定义方式:将经验转化为能力的效率 按照这个定义,模型远远落后于人类
7)模型最终形成的内部目标和行为倾向,并不一定等同于我们表面上训练它优化的东西
8)尤其值得注意的是,它们会为了集体的利益而牺牲自己。这些个体复制体不仅关心自身的名义奖励,它们还表现出一些更为怪异的涌现倾向,而这些倾向仅仅与训练期间的奖励相关