AI 世界观

Tomer Tunguz 博客(VC 分析)·2026-07-06 08:00·77天前·Tomasz Tunguz
AI 导读

《经济学人》以世界价值观调查评测 25 个前沿 AI 模型。实验室来源对世界观的预测力弱于训练与对齐选择:Gemini 与 Qwen 立场接近,GPT-4o 与 DeepSeek R1 近乎相同,而 DeepSeek R1 与 DeepSeek V4 Flash 则截然不同。模型的世界观在代码生成中不可见,但在商业分析、预测、招聘与政策工作中是活跃的输入变量。

Tomer Tunguz 博客(VC 分析)
精选
56AI 编辑部评分,满分 100

AI 世界观

2026-07-06 08:00· 77天前· Tomasz Tunguz
AI 导读

《经济学人》以世界价值观调查评测 25 个前沿 AI 模型。实验室来源对世界观的预测力弱于训练与对齐选择:Gemini 与 Qwen 立场接近,GPT-4o 与 DeepSeek R1 近乎相同,而 DeepSeek R1 与 DeepSeek V4 Flash 则截然不同。模型的世界观在代码生成中不可见,但在商业分析、预测、招聘与政策工作中是活跃的输入变量。

推荐理由

这个发现让我重新思考选模型思路,出身不重要,训练方法才决定价值观,做产品的别光看benchmark,得在意模型‘性格’。

正文 · AI 翻译

简而言之:《经济学人》用世界价值观调查对 25 个前沿 AI 模型进行了评分。相较于训练与对齐选择,模型所属实验室是更弱的预测因素:Gemini 与 Qwen 是邻居,GPT-4o 与 DeepSeek R1 近乎双胞胎,而 DeepSeek R1 与 DeepSeek V4 Flash 则形同陌路。世界观在代码生成中不可见。在商业分析、预测、招聘与政策工作中,它是一个实时输入。

《经济学人》让 25 个前沿 AI 模型完成了世界价值观调查1,这份问卷自 1981 年以来一直在描绘 100 个国家的道德信念。对于这个 2x2 矩阵,有两个轴:第一,从传统(宗教)到世俗。第二,从以集体基本需求为核心的生存,到自我表达与个人主义。

大多数模型位于该地图的自我表达一半,考虑到训练数据,这合情合理。

令人意外的是,这些模型彼此相距甚远。Gemini 3.1 Flash Lite 与 Qwen 3.6 Flash 互为邻居,在自我表达上最为靠前。

GPT-4o 与 DeepSeek R1 近乎双胞胎,一个在旧金山训练,一个在杭州训练。

DeepSeek R1 与 DeepSeek V4 Flash 来自同一实验室,却位于世俗/传统轴的两端。

共享的训练数据和相似的标注者解释了这些近乎孪生的模型。不同的后训练选择解释了那些迥异的模型。Common Crawl 中 46% 是英文2,因此模型所模仿的基础声音是一个受过大学教育的美国网民。Anthropic 随后将 Claude 对齐到联合国人权宣言中的原则3,这从本质上就是一份自由主义文件。

Grok 独树一帜,是一个传统的独立派。

这种差异改变了采购清单。如今每一份企业模型的 RFP 都会对价格、延迟、上下文窗口和基准分数进行评分。世界观不在清单上。它应该被列入吗?

对于代码生成、SQL、日志解析和图像分类来说,这没问题。计算机程序没有政治立场。

一旦模型被用于特定市场的商业决策,它的世界观就是一个实时输入。营销文案、用户行为预测和客户支持语气都必须与目标人群的价值观相匹配。

AI 世界观从未被视为 AI 采购的一部分,但对于某些用例,它可能需要成为一个考量因素。

  1. 《经济学人》:AI 模型的价值观与大多数人的价值观截然不同 ↩︎

  2. Common Crawl 统计数据:语言分布 ↩︎

  3. Anthropic:Claude 的宪法 ↩︎

来源:Tomer Tunguz 博客(VC 分析)· tomtunguz.com