# 样本效率黑洞：AI能力背后隐藏的数据需求深渊

- 来源：Dwarkesh Patel：Podcast & Blog（RSS）
- 作者：Dwarkesh Patel
- 发布时间：2026-06-09 02:09
- AIHOT 分数：66
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmq5j7nkn002fsl385mhl7d2d
- 原文链接：https://www.dwarkesh.com/p/the-sample-efficiency-black-hole

## 精选理由

Dwarkesh 把 AI 样本效率低的问题算透了，人类 2 亿 token 学会的事，模型要万亿级，缩放定律也补不上这个黑洞。做 AI 的该认真想想，数据驱动这条路有没有尽头。

## AI 摘要

将AI比作一个闪耀着能力的星系，其核心存在一个肉眼不可见的巨大黑洞——数据。这个比喻揭示了AI模型惊人能力背后对海量数据的依赖，样本效率的瓶颈如同引力中心，将各色能力凝聚在一起。

## 正文

对智能的一种定义是样本效率——也就是说，在某个给定领域里，你需要看过多少数据才能流畅且胜任地运作。过去几年里，我们在训练样本效率上是否真的取得了很大进展，这一点并不清楚——看起来更像是我们大幅拓宽并改进了数据分布。

AI 一直在变好的主要方式，是通过加入更多且更好的数据，并扩展算力来首先开发这些数据。显然，RL 是实现这一点的主要方式。你可以把 RL 看作一种合成数据生成——你投入大量算力去对抗一个验证器，以找出“好的”数据。然后你训练模型去预测这些正确的 rollout，方式很像你训练它去预测互联网文本中的下一个词。

要让这个过程奏效，模型必须至少先验地具备一定概率来预判出正确解法，这也是为什么你还需要在每一个你希望模型胜任的领域和技能上，拥有数量惊人的人类专家轨迹。

这种人类专家数据有多么任务特定、多么量身定制，很难被夸大。如果你想获得一些直观感受，可以去读读Mercor或 Surge 网站上的一些职位描述。那里有文字专家的招聘信息，负责把遗留文档转换成精美的 Word 文件；还有法律专家，负责撰写逼真的并购尽职调查或证券申报文件；还有管理咨询顾问，负责撰写模板化市场研究，以及几十种其他特定类别。

而且不仅数据必须如此具有领域特异性，数据量还必须如此庞大！每一项技能都对应着至少数百名人类专家，他们在生成示例补全、撰写评分标准，并解释自己的思维链。这个生产专家标注（以及让这些被精心编目的技能得以凝结成形的 RL 环境）的数据产业每年能赚取数十亿美元的收入，很快就会达到数百亿美元，这是有原因的。

想象一下，如果你要学会打磨一个 Word 文件，需要上几十年的课程、同时有数百位教授授课、还要完成数百万道练习任务。即便这样，任务数量的差距仍然低估了真正的鸿沟——模型必须反复打磨它们那数量远为庞大的任务，而且每一项任务都难得多。人类学生可能把一道教科书习题练上一两遍，而 GRPO 会让模型对每项任务生成数百到数千次 rollout。我们正在打造某种弗兰肯斯坦式的怪物，由十亿块精心构造的示例嫁接缝合而成。

Epoch 最近报告称，开源模型仅落后最先进的闭源模型 4 个月。我认为，开源模型和此前的落后者之所以能相对容易地在几个月内追上前沿，原因在于数据才是进步的真正驱动力。而数据可以很容易地从公开 API 中蒸馏出来，超参数、训练技巧和架构上的微观优化则不能——如果后者才是推动大部分进步的因素，那么追赶的难度会比我们观察到的更大。

人们很容易忘记这些模型训练所用的数据量有多大，以及它比我们人类一生中所见的数据多出多少。我们把这些 AI 看作一个闪烁着各种能力的星系，但在它们的中心，肉眼不可见地、将所有星座维系在一起的，是一个难以想象的巨大数据黑洞。

幕间：比较人类与 AI 的样本效率

如果一个人平均每小时听到和看到约 2,000 个词，那么从出生到成年，他们会看到约 2 亿个 token。相比之下，前沿模型训练所用的数据在 10 万亿到 100 万亿 token 之间。这接近一百万倍的差距。

一个人可以在几小时内学会遥操作任何随机的人形机器人或机械臂。机器人技术之所以还没有成为一个十万亿美元级的产业、拥有无穷无尽的 Unitree G1 大军在世界上做各种有用的工作，原因就在于我们的 AI 学习效率远低于人类，即使我们已经收集了数百万小时的演示数据，也不足以让它们执行复杂的、开放式的任务。

一个青少年大约练习 20 小时就能学会开车。即使把他约 16 年积累的物理直觉也算作相关训练数据，那也至少比 Waymo 和 Tesla 训练其自动驾驶汽车模型所需的数据量少了 3-4 个数量级。

我想回应一些对这种比较的常见反对意见：

数十亿年的进化就是我们的预训练，所以把我们一生中所见到的如此之少的数据，与这些冷启动的大语言模型必须从中学习的数据相比，是不公平的。

我们的基因组是 3GB，其中大约 1-2% 是蛋白质编码。这根本不足以存储据称经过预训练的模型参数（前沿模型的规模达到数 TB）。更贴切的类比大概是：进化找到了正确的超参数和损失函数（旁注：我曾与 Adam Marblestone 做过一期有趣的播客，他在其中主张，损失函数才是进化更重大的发现），但相当于参数训练的过程仍然在一生之中持续进行，并被编码在一生中构建起来的大脑神经连接图谱里。

即便我们能够把预训练一个基础模型所需的数万亿 token 解释为是在追赶进化，这仍然无法解释为什么边际能力需要如此多的数据——一旦你接受了教育，你不需要 100 位不同的教授来学习一门新的编程语言，但 AI（即便已经过预训练）却需要。

这些比较并未计入我们一生中所见到的多模态数据。如果把所有这些感官信息都算进去，我们从出生到成年大概处于 10s 到 100s of billions of tokens 的量级。

被隔绝于这类感官信息的盲人/聋人可能缺乏相应感官的能力，但仍然拥有与其他人相同的通用智能。这表明，这数十亿的感官 token 并不是真正让人类变聪明的东西。

事实上，只能通过手语和阅读（而非听觉）交流的聋人，其摄入的语言 token 量远低于我们此前计算的 2 亿，而即便如此，也足以让他们成为完全通用的智能。

缩放定律告诉我们，更大的模型样本效率更高。人脑有 100T 个突触——如果每个突触约为 1 个参数，而当前前沿模型大约为 5T 参数，那么也许再扩大一两个数量级的参数规模，我们就能达到人类水平的样本效率。

缩放定律方程的工作原理是，参数项和数据项被独立地加到损失上。如果你有一个以计算最优方式训练的模型，假设你问：如果我只想最大化样本效率、使用更少的数据——而我会不惜投入任意多的参数来实现这一点，那会怎样？用 Chinchilla 缩放定律论文中的常数（即便换成不同的常数，结果的性质也不会改变），即使你把参数数量增加到无穷大，也只能把保持相同损失所需的数据量减少约 10 倍。

人类的样本效率比这些模型高出数千到数百万倍。当前模型的缩放根本无法弥补这一差距。这确实表明，人类处在一条完全不同的缩放曲线上。

样本效率重要吗？

但你可能会问，样本效率为什么重要？实验室有两个总体目标：自动化白领工作，以及自动化 AI 研究本身。人类水平的样本效率对其中任何一个来说是必需的吗？

白领工作的赌注在于，软件工程师、分析师或会计师所做的常见任务是，嗯，常见的。而我们可以通过 RL 和 SFT 相当容易地把常见任务带入分布之中。这些 AI 实验室的收入曲线表明，即使我们无法复现人类的样本效率，把任务带入分布之中也能带来巨大的价值。

是的，训练 AI 来完成这些任务，效率远低于训练人类。但那又怎样？人类的寿命不允许这些模型所经历的训练在数量和广度上达到那样的程度。如果你作为一个人，有某种奇怪的学习障碍，需要读遍 Github 上每一个公开仓库才能成为一名合格的开发者，那么把你训练出来就是不合理的。

你在教育的早期阶段就会靠社会保障过活了，而且即便你训练完成，你也一次只能做一个项目。但 AI 可以通过一次灌入吉瓦级的训练来学会这些技能。而它们所学到的东西可以摊销到数十亿次会话中，所以我们可以在训练它们时荒谬地低效，却仍然大幅盈利。

白领员工需要做多少“分布外”的思考，而这些是你根本无法提前训练的？这其实更多是关于不同工作性质的问题，而不是关于 AI 研究的问题。而且这也取决于具体工作——有些工作足够机械、足够可预测，早在现代 AI 时代之前就已经被自动化了，比如银行柜员或旅行社代理。

还有一些工作则需要每天处理与数据分布相距甚远的问题。即便是软件工程（AI 被认为会最先取代的工作）也是其中之一。我敢打赌，2028 年对人类软件工程师的总体需求会比现在更多，很大程度上是因为 AI 的互补性投入。

实验室对后一类工作的计划是，先自动化 AI 研究，然后让自动化的 AI 研究员来解决这个样本效率问题。所以问题就变成了：那些不具备人类水平样本效率的 AI，是否仍然能够解决通往类人智能与学习之路上的剩余研究问题。

这个问题我会在未来的博客文章中讨论——我认为人们目前对智能爆炸的思考方式相当笨拙。要么人们完全否定 AI 加速 AI 进展的可能性，要么他们就只是假设最后会凭空冒出一个神。人们并没有在推理，从 LLM 开始，极其迅速的进展究竟会是什么样子。
