Claude Fable 发布:Anthropic 带来的另一种推理体验

Ethan Mollick:One Useful Thing(RSS)·2026-06-10 01:11·104天前·Ethan Mollick
AI 导读

Anthropic 发布 Claude Fable,这是一款提供截然不同推理体验的 AI 模型。它擅长规划与生成复杂代码库,在需要精确构建代码结构或理解程序员深层需求的场景中,其表现相比 Claude Sonnet 有了大幅提升。用户描述与它协作更像与一位直觉敏锐的资深工程师合作,其对代码意图的捕捉和方案生成能力令人惊叹,但并非通用型 AI。

Ethan Mollick:One Useful Thing(RSS)
精选
77AI 编辑部评分,满分 100

Claude Fable 发布:Anthropic 带来的另一种推理体验

2026-06-10 01:11· 104天前· Ethan Mollick
AI 导读

Anthropic 发布 Claude Fable,这是一款提供截然不同推理体验的 AI 模型。它擅长规划与生成复杂代码库,在需要精确构建代码结构或理解程序员深层需求的场景中,其表现相比 Claude Sonnet 有了大幅提升。用户描述与它协作更像与一位直觉敏锐的资深工程师合作,其对代码意图的捕捉和方案生成能力令人惊叹,但并非通用型 AI。

推荐理由

Ethan Mollick 对 Mythos 级模型的实际体验,比任何参数对比都更清晰地描绘了未来人机协作的形态改变:从“指导者”变成“赞助者”。这篇体验不是评测,是一个信号。

正文 · AI 翻译

Claude Fable 代表着 AI 的又一次巨大飞跃

Ethan Mollick

2026年6月9日

我提前获得了首个即将向公众发布的 Mythos 级 AI 模型 Claude 5 Fable 的访问权限。目前关于 Mythos 的讨论大多集中在其对软件安全的影响上,但我在除这方面之外的所有领域都进行了测试(围绕 Fable 的防护机制基本上完全阻止它被用于网络安全)。我的结论是:它相对于我用过的所有模型都是一次非常真实的跨越,而且,或许更重要的是,它表明我们与 AI 的关系正在发生剧烈的变化。

首先,Fable 到底有多强?在我进行的一项又一项实验中,它以相当大的优势超越了我用过的几乎所有其他公开模型。它在众多问题上都表现出色,并产出了一些令人惊叹的结果——它能连续工作长达十几个小时,执行多页规格说明的任务。稍后我会带你看几个更复杂、更严肃的使用案例,但你能看到它在每一项任务上都有全面提升。在这篇文章里传达这一点的问题在于,许多最令人印象深刻的结果只会对我的一部分读者有吸引力。例如,它仅凭一个提示词和一条反馈,就做出了我迄今见过的 AI 所写出的最精深的学术社会科学论文。它还创作了一首 10 页的史诗押韵长诗,主题是理发,且每个单词都以字母 s 开头。

所以,作为一个更容易上手、也更有趣的例子,我还让它做了一批游戏供你试玩。所有这些都只需要在 Claude Code 中输入一条初始提示词,Fable 必须把我模糊的提示词转化成可运行的东西,之后再加上几条简单的鼓励(“把它做得更好”)或反馈。这些作品特别令人印象深刻的地方在于,Claude 无法生成图像,所以每一件美术素材或 3D 物体都是纯粹用数学造出来的,没有使用任何外部资源。你可以试试其中任何一个:一个抛硬币游戏(提示词:“Balatro,但玩法是抛硬币”),相当好玩;一个贪吃蛇游戏,蛇是自我意识的,会发生各种疯狂的事情;还有一个关于沉入深渊、看看那里有什么的游戏。

所以产出确实令人印象深刻。但是,尤其是在我转向更严肃的项目时,我常常觉得使用这个工具体验介于愉悦和不安之间。愉悦是因为我只是提了个要求,事情就成了。不安也是因为我只是提了个要求,事情就成了。

地图与方法

要理解原因,最好先了解 Fable 是如何完成工作的,为此我想用一个我在许多此前的 AI 模型上测试过的例子:构建等时线地图。这是一种展示在给定时间内你能走多远的地图,最早的一张诞生于 1881 年,展示的是从伦敦出发的旅行时间。

最初的地图

以往的模型在尝试绘制这样一张地图时,都做不出哪怕勉强可用的成果,因为这需要研究数千个潜在的行程距离,还要做大量细小的判断和决策。我决定在 Fable 上用 Claude Code 试试,提示词如下:我要你构建一张经过充分研究、设计精美的等时线地图,让我可以选择多个城市,并基于真实数据查看真实的等时线。我希望设计是独一无二的。你需要考虑飞机(以及往返机场的时间)、火车、步行和驾车。数据不需要是实时的,但应该基于你的研究和数据,是真实的。你可以先从几个城市入手,但覆盖越广越好,这应该是一个全新的项目。随后它建议按原版地图的风格来做。我同意了,它便开始工作。

值得再看一遍这段 AI 自主进行的长达数小时的构建过程记录,因为你能看到一些不寻常的事情。首先,这个 AI 启动了多个其他 AI(我相信大多是较便宜的 Claude Sonnet)来帮助它研究出行时间,最终检索了超过 2,200 个具体航班、从 TGV 到新干线的各类列车时刻表,以及来自多篇学术论文的各国道路速度数据。

而在这些智能体运行的同时,它开始编写代码。接着它又启动了更多智能体和测试来验证自己的代码,整个过程还一直在记录自己的进展笔记。

最终得到的是一张功能完备、精细程度令人印象深刻的地图,看起来和 1881 年的原版非常相似,但这并不意味着它完美无缺。我注意到很多偏远地点(比如格陵兰)只包含旅行时间的估算值,而非精确数字,于是我让 Fable 修复这个问题,指令中包括:实际查明到偏远机场和地点的旅行时间。这一次,AI 启动了一个工作流,由相互对抗的智能体小组进行研究并互相验证结果。它弄清了船只开往太平洋皮特凯恩岛的频率,以及如何从渥太华前往格里斯峡湾。而且它在极短的时间内消耗了巨量的 token(稍后会详细讲到这一点)。

结果令人印象深刻。我又朝着我感兴趣的方向推动了几次(包括要求采用其他可视化方式等)。我建议花几分钟点击浏览这些结果,你还可以在图表底部查看它所使用的方法和来源。

AI 生成的内容。点击地图可前往交互版本

除非你真的热爱旅行和地图,否则这对你来说可能算不上一个有用的项目,但它表明 AI 能够解决一个涉及研究、数学、可视化开发、审美、判断、复杂编程等方面的难题。而且,令人不安的是我实际做的事情少之又少。我给出一个非常宏大的指令,AI 照做了。我给出几条小幅反馈,AI 自己就搞定了。我扮演的角色极其有限。

重要的是,不仅我相对于模型所做的工作量受限,我对模型如何做事的控制权也受限,比如模型为什么选择特定的方法,甚至其结果的深入程度也无法掌控。AI 决策过程的细节并没有展示给我,而且整个过程太长,根本不值得去逐步跟进。这张地图要求 AI 对数百个小选择做出判断,而它就直接做了,既没有让我理解这些选择,也没给我参与权衡的机会。从很多方面看,这堪称奇迹(我随时可以在最后要求修改);但从另一方面看,它把 AI 变成了终极黑箱。

与 Mythos 级别的模型协作

我从 Fable 得到的最雄心勃勃的项目需要多解释几句。我做过很多研究,其中人类会给出杂乱的答案,而任何形式的分析都需要对这些答案进行恰当的分类:一个想法有多创新?人们为什么喜欢这本书?为了弄清这些问题,我们过去依靠人类研究人员对某条信息做出判断,再用统计方法比较他们彼此的答案,以确定数据是否可信。近期大量研究表明,AI 或许能够完成这项重要工作,但校准 AI 与人类判断一直既困难又昂贵。于是我让 Fable 来解决这个问题,它先 生成了一份长达 19 页的复杂设计文档,然后着手执行。

它连续工作了九个半小时。

最终产出的是一个极其复杂的软件,AI 将其命名为 Concord,它可以接收多个数据集,校准人类与 AI 的响应,然后对结果进行复杂的数据分析。再次强调,它并不完美。作为领域专家,我能发现一些错误和遗漏(其中一些源于我要求的设计),并让 AI 加以修正。但这个项目以及许多其他项目的交付范围,超出了我以往见过的任何东西。就本例而言,这是一个研究人员多年来一直需要、却因不具盈利性而从未被开发出来的软件。你现在可以直接在这里使用或修改这些代码。我确信它并不完美(我只花了一个小时检查结果),但软件工程师可以解决那些我没能快速发现的潜在 bug(这也是为什么未来我们可能需要更多、而不是更少的程序员,来应对软件新用途的爆发式增长)。

这种能力伴随着怪异之处和局限性。局限之一是它的 token 消耗。Fable 的价格是 Opus 的两倍,而且它烧 token 的速度表明,它在生产环境中成本几何的答案是“很多”,尽管它巧妙地把任务委派给更便宜的模型,可能会大幅降低实际价格。

Fable 的安全护栏也会在最轻微的安全问题迹象下被触发,退回到较弱的 Claude 4.8 Opus,而且这种情况发生得太频繁了。锯齿状边界依然存在。例如,这个 AI 仍然用同样的怪异风格写作(事实上 Fable 生成的软件也带有 Claude 味的痕迹;它的进度报告也是如此,全是那种“承担重负、赢得答案”的腔调)。

但更深层的怪异之处在于,我几乎不需要做任何事,而且在它工作的过程中,我几乎什么都看不到。

去年我曾把这比作与一位巫师共事:你念动咒语,某件事就会发生。而如今有了 Fable,这咒语已经强大到我不再确定自己还是不是那个巫师。我更像是一位赞助人。我描述我想要什么,我付钱,然后我评判结果。施展魔法的过程发生在我无法目睹的地方,藏在成百上千个我从未有投票权的小决定之中。工作已从过程转向了结果。我不再掌控方向;我只是在委托。

这种被边缘化的状况有可能是暂时的,只是界面尚未跟上的产物,我们或许会得到更好的窗口来观察这些模型在做什么,以及更好的中途干预方式。但也有可能恰恰相反:模型能力越强,人类能做的有意义的事情就越少,而黑箱就是这种力量的代价。

我怀疑后者更可能是真实的方向。这些都不是显而易见意义上的失控。我依然可以引导 Fable,而且它对指令的服从能力非常出色:指令越宏大,结果越好。但引导已不再等同于亲手去做。我给模型做简报,它启动自己的智能体去研究、写作并互相检查工作,交回来的就是成品。

一位赞助人委托的是一位艺术家。而 Fable 更接近于一整个工作室,我只是那个在最终作品上签字验收、却从未踏进工作室半步的客户。

来源:Ethan Mollick:One Useful Thing(RSS)· oneusefulthing.org