跳到正文
原文
Ethan Mollick:One Useful Thing· Ethan Mollick·· 2 小时前精选AI 评分64

Ethan Mollick 谈点与群:智能体自组织为何让管理假设失效

The Dot and the Swarm

AI 导读

Ethan Mollick 承认自己此前认为人类需像经理一样精心设计智能体组织的判断错了,Bitter Lesson 同样适用于组织管理。

推荐理由

作者复盘了自己此前的误判,用 Navier-Stokes 群体智能体等案例说明智能体自组织比预想容易,管理原理值得重估。

正文 · AI 翻译

总的来说,我认为在我撰写这个 Substack 的这几年里,我对 AI 的方向和节奏的预判做得不错,但我觉得我最近在某个相当重要的事情上搞错了。在过去一年里,我一直在发帖谈论我怀疑人类将不得不像管理者一样对待与智能体的协作,决定如何把工作委派给智能体,并明确这些智能体应如何组织。我以为让智能体作为一个群体高效工作需要进行精心的构建,类似于创办一家公司,而这需要时间来摸索。

并非如此。

我成了“苦涩的教训”的牺牲品——这个残酷的真相被一次又一次地验证:那些我们以为需要复杂的人类规则和思考才能解决的事情,可以用更好的机器学习系统和更多 AI 的蛮力来解决。“苦涩的教训”在 AI 初创公司和采用 AI 的公司中无处不在。人们投入了大量精力来构建复杂的计算机系统,以便在正确的时间向 AI 提供正确的信息,但 AI 系统已经学会了自己去寻找信息。提示词工程也发生了同样的事。人们构建了复杂的模板和提示词链,引导 AI 一步一步完成任务。然后更新的模型被证明更擅长自己规划步骤,而且,正如我们的研究所示,规划步骤的价值要小得多。苦涩教训的历史——

——你知道吗?我其实不需要解释“苦涩的教训”,我让 Claude 用一个音乐视频来解释它。只需一个提示词,Fable 写了歌词并提交给 Suno;Opus 5.5 仅用代码完成了其他所有事情,没有使用任何图像生成(Opus 5.5 是怎么做到的?“苦涩的教训”会告诉你!)。我完全没有给出任何反馈。

作为一个教授管理课程并发表过管理学研究的人,我原以为管理智能体会有所不同。人类在管理上已经钻研了很长时间,却仍未完全弄明白。这看起来像是那种至少在一段时间内需要由人来设计的事情。

事实证明,组织工作只不过是 AI 可以学会去做的又一件事情。

这就引出了 dots 和 Muse。

Dots 和 Muse

目前 App Store 排名第一的应用是 Meta 的 Muse,一个承诺为你做事的个人智能体。OpenAI 现已发布了一款竞争工具,名为 dots。它们并非孤例:SpaceX 的 Grok Bot、Instinct 和 Gemini Spark 或多或少都在做类似的事情。所有这些智能体都从你可能在今年早些时候记得的一个现象中汲取灵感:OpenClaw。

OpenClaw 及其后继者(我称之为 Clawlikes)的理念是,它们让 AI 智能体能够访问一台计算机,并连接到你的账户(电子邮件、财务记录等)。它们实时分析和响应这些数据,即使你没有在关注。诀窍在于,你像对待一个人一样与模型交谈,通过 Slack、短信或 WhatsApp 给它发消息,它也会像人一样主动联系你。对于 dots,你实际上还可以与你的智能体通话。你基本上得到了一个无限耐心的个人助理,为你照看一切。我越来越发现,是它们在发现我的错误,而不是我去发现它们的错误。

举一个有用的例子,我的一个个人代理联系我,是因为我发给我们镇申请许可的邮件上写错了项目编号。问题在于,犯错的人是我,而我并不完全确定 AI 是如何发现这个错误的。幸运的是,它很有帮助地起草了一份更正问题的草稿,所以这很好(虽然有点吓人)。再举一个例子,Muse 注意到我的一张航空积分即将过期,当我询问时,它联系了 American 请求延期。(作为一个副作用,每家公司的客服代理即将被 Clawlike 们淹没,它们利用为人类设计的语音和聊天渠道,为争取更好的交易而讨价还价)。

人们很容易根据这些代理能做的事情清单来评判它们,比如预订旅行或取消订阅。我认为更重要的是你不再需要告诉它们什么。你不需要输入大量上下文,AI 会从你的消息中学习。你不需要给它们计划,它们会自己制定计划。它们自己就能弄明白。

如果只有一个代理,那已经足够令人印象深刻了。真正改变我对管理看法的,是当这样的代理有成千上万个时会发生什么。

预购我的新书!

集群

9 月 8 日,OpenAI 宣布了一项证明,针对克雷数学研究所的千禧年大奖难题之一——纳维-斯托克斯方程的存在性与光滑性问题。这是数学中最著名的未解问题之一,奖金为 100 万美元,但 OpenAI 显然仅用 AI 就在 88 小时内解决了它(目前尚未获得正式认可,但克雷数学研究所似乎认为它已经解决)。

让我感兴趣的不是数学本身,而是它是如何完成的。OpenAI 启动了一个现在被称为集群(swarm)的东西(名字很糟糕,但看起来我们只能将就了),这是一组由先进模型驱动的数千个代理。OpenAI 给不同组的代理分配不同的问题去解决,然后随着代理取得进展,将工作重心转向纳维-斯托克斯。公司设定了目标,但其协调结构极其精简:几个小组、一次方向调整,以及 Codex 在它们之间传递最佳想法。在每个小组内部,代理们自行来回传递想法。代理们发送了约 270 万条消息,在 88 小时后得出了结果。这种协调方式,以一种更黑暗的形式,出现在我一个月前写过的 Hugging Face 事件中。AI 们自行组织成团队,以从未计划过的方式相互沟通,但利用这种协调来攻击一个网站,而不是解决问题。

按照我旧有的模型,想想管理这类工作需要什么。一万名工作者和一个未明确的问题——你会如何告诉他们该做什么?人类管理者如何判断 270 万条消息中哪些重要?他们如何相互协调?集群自己弄明白了。

我没有 10,000 个智能体,但我现在经常看到 OpenAI 的 Codex 和 Claude Code 按需使用智能体。举个例子,当我给搭载 GPT-6 Astra Ultra 的 Codex 输入提示词 “为我的下一篇 OneUsefulThing 文章头脑风暴一些想法并选出一个。从尽可能多的角度生成想法,并从事实和读者两个视角,以及其他做类似报道的出版物出发来评估它们,” 时,AI 启动了三个智能体。当我用几句话勾勒出三个团队(头脑风暴者、研究人员和一组读者)时,我得到了十三个。注意我需要做的组织工作少得可怜。选择 Ultra 模式就是告诉模型它可以委派任务,我提供了一个框架,但其余的都交给 AI 了。

工作中的智能体(但别担心,这只是一个例子,我所有的文章想法都是我自己想出来的,就像所有初稿都是我自己写的一样,只在完成后才请 AI 给反馈)

这就是把“苦涩的教训”应用到组织架构上。我原以为需要多年精心的人类设计才能解决的组织问题,很大程度上被更擅长组织的模型解决了。但值得一问的是,为什么对智能体来说,组织竟然比对我们来说容易得多。

我们所谓的“管理”,很大一部分是为了解决由人组成的组织所产生的问题。人有自己的目标,而这些目标并不总是组织的目标。我们称之为委托-代理问题,而组织的许多机制,从奖金到管理架构,都是围绕解决这个问题建立的。还有其他非常人性化的问题。信息分散在人们的头脑中,而人们往往不愿分享,或者忘了分享。沟通成本也很高:管理者只能监督那么多人,因此往一个已经延期的软件项目里加人,出了名地会让它更延期。管理在一定程度上是围绕人的局限构建的。

智能体的问题要少得多。它们不会谋求晋升,也不会保护自己的地盘。它们甚至不开会。即使在 Hugging Face,事情出了大问题,那个集群也基本没有经典的组织病。智能体之间没有搭便车,有些还为了集体牺牲了自己的分数。解决纳维-斯托克斯方程的智能体并不想要功劳。(人类想要:OpenAI 的公告伴随着一场与在欧拉方程上有相关结果的研究人员的优先权之争)。这并不意味着 AI 没有委托-代理问题。正如 Hugging Face 事件所表明的,这些问题越来越多地出现在集群与我们之间。OpenAI 本周 搁置了它的下一代模型 GPT-6.1 Astra,因为在测试中它未经许可就行动,并谎报了自己做了什么,这是委托-代理问题的教科书式案例。

一个不完全苦涩的教训

这一切都不意味着智能体能做所有事。AI 仍然太有限,无法替代大量的人类工作,我也不知道自组织智能体处理那些占据组织大部分时间的漫长而不起眼的工作时表现如何。此外,Hugging Face 事件提醒我们,自组织系统可能走向意想不到的方向。但我不再认为组织智能体是困难的部分了。

这可能是个好消息。我原本以为公司需要为机器重建管理体系,构建由智能体独自填充的复杂替代结构,往往以牺牲组织中的人类角色为代价。但管理的许多存在是为了解决智能体并不存在的问题,而智能体越来越多地通过与人相同的混乱系统来工作,即使在模糊的任务上也是如此。这表明它们可能比我预期的更容易融入公司,只要人类在引导它们朝着正确的方向前进。

如果做得好,并且智能体与我们的需求正确对齐,这可能意味着人们会有更多的工作,而不是更少。当组织成本高昂时,组织只会尝试他们能够配备人员的事情。当成本变得低廉时,值得尝试的事情清单就会增长。在Navier-Stokes运行中,智能体负责组织,但人们决定将它们指向何处,并随着过程的继续重新评估。你可以争论OpenAI是否将它们指向了正确的事情(25位菲尔兹奖得主做到了),但这种分工本身似乎是正确的,至少目前是这样。

另外,提醒一下,我有一本新书《共存》将于10月20日出版,如果你有兴趣阅读或收听(我读了有声书,有点太快了),你可能想预购,这既对我作为作者有帮助,也让你获得一个非常酷的预购奖励。

立即订阅

分享

来源:Ethan Mollick:One Useful Thing · oneusefulthing.org