数学家称消化 OpenAI 突然发布的近 400 项 AI 数学结果可能需要数年
‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop
OpenAI 本周突然发布近 400 项 AI 生成的数学结果,分布在 719 份手稿中,涵盖组合数学、数论、拓扑等多个学科,其中仅约 42% 已在 Lean 中形式化验证。
同一新闻,精选展示《OpenAI 发布内部前沿模型产出的数学研究成果》
“令人震惊。”“铺天盖地。”“前所未有。”“超现实。”“纯粹的疯狂。”
这些是三十多位数学家在与The Verge交谈时用来形容自己感受的词语,他们试图理解OpenAI本周突然抛向该领域的海量数学成果。在敬畏、兴奋和对这场洪流规模的难以置信之中,还潜藏着一种深层的焦虑——这一切意味着什么,以及接下来会发生什么。尽管反应各异,研究人员一致认为,仅仅理解OpenAI发布了什么就可能需要数年时间,更不用说弄清楚数学家们自己在这个正围绕他们发生变化的领域中处于什么位置了。许多人担心OpenAI不会等那么久就会转向下一步——或者发布更多成果。
总的来说,OpenAI发布了近400项AI生成的成果。这些成果分布在700多份手稿中,涵盖了多个数学学科,包括组合数学、几何学的若干分支、数论、理论计算机科学、代数、拓扑学、概率论与统计力学,以及数学物理。这个合集如此庞大,以至于OpenAI觉得有必要发布指南,说明如何浏览这个庞大的GitHub仓库。
如此庞大的工作量使得即便只是初步评估该公司究竟发布了什么都很困难。在发布后的数小时和数天里,大多数接受The Verge采访的数学家表示,他们仍在努力消化所有内容;有几位说,仅仅浏览大约40页的目录和摘要就花了他们将近一个小时。“光是看完整份摘要列表就让人不堪重负,”康涅狄格大学数学教授Álvaro Lozano-Robledo说。
在数百份手稿中,零星散布着Lean形式化证明。Lean是一种编程语言和证明助手,允许通过计算来验证结果。这些形式化证明在评估OpenAI此前的一些数学声明时发挥了关键作用,让研究人员即便没有完全理解背后的论证,也能对某个声明的逻辑正确性抱有信心。
“如果AI现在消失了,就像外星人来到地球然后又离开了,我们也会在未来10年里研究这些东西,试图理解一切。”
但每项成果被验证的程度参差不齐。在GitHub上,OpenAI承认这些成果“处于不同的验证阶段”,并且“许多——但并非全部——手稿已被形式化”。截至撰稿时,该合集中不到一半的手稿似乎已被正式描述。OpenAI表示,719份手稿中只有300项顶级成果已被形式化,约占42%,并称“将在获得更多形式化证明后更新仓库”。
多位数学家向 The Verge 抱怨缺乏形式化,尤其是考虑到成果数量之庞大,并强调即便某项结果附带了 Lean 代码,评估也并非即时完成。研究人员必须核查形式化是否真正证明了该结果所声称的内容,这又是一个耗时的过程,而几位深入研读论文的人表示,即便提供了可由计算机验证的证明,其质量也参差不齐,且它们所验证的陈述并不总能与随附手稿中的主张严丝合缝地对应。
伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己所属的代数数论领域中发现,众多定理中只有大约六个立刻“脱颖而出”。这些定理中,似乎几乎没有几个在 Lean 中被形式化验证过。“因此,我要么得去读那些可能并不正确的垃圾内容,要么等别人也这么做,要么等有人把它们形式化,然后我才能确定这些结果究竟是否正确。”Buzzard 的担忧得到了许多其他研究者的呼应。
对 AI“垃圾内容”感到担忧的远不止 Buzzard 一人。这个词是低质量、常常错误的 AI 生成材料的简称,这类内容正越来越多地出现在网上——以及现实世界中——包括学术论文。与其他领域一样,数学家们告诉 The Verge,近年来他们看到用 ChatGPT 和 Claude 等工具生成的此类材料大幅增加。其中许多内容令人困惑、难以阅读,且几乎不体现对该主题的理解;在给其他研究者署名方面尤其粗劣。
OpenAI 此前的数学论文曾被专家广泛批评,指其草率,尤其是署名不当或完全缺失。在发布前与 The Verge 的交谈中,几位研究者已把即将涌来的论文潮称为“slopocalypse”(垃圾末日),或类似的说法。
所担心的“slopocalypse”是否真的成为现实,很难说,很大程度上是因为发布出来的材料数量多得令人眼花缭乱。早期迹象表明,OpenAI 这一次在论文上更为用心,至少对其中一些是如此。几位数学家告诉 The Verge,他们的第一印象远好于预期,不过他们也承认,鉴于该公司此前粗劣的发表记录,这个门槛本来就不高。
“这是一团大乱。它可能导致学术文化的大崩溃,并直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视了这个问题。”
但更好并不一定意味着好,更不用说达到人们通常对做出如此重大主张的学术工作所期望的标准了。由于 OpenAI 的许多主张缺乏形式化验证,随附论文的质量就变得尤为重要;它们是数学家们确认、理解、审视并为这些结果提供背景的主要途径。
即使在最好的情况下,产出严谨的数学论文也是一项艰难的工作。以这种规模来做,更是一项艰巨的任务。OpenAI 的模型正以令人眼花缭乱的速度、横跨广泛的专业领域大量产出数学成果,远远超出了其人类员工的处理能力。该公司根本不具备足够的专业广度或资源,来妥善审查其在数学前沿的发现。研究人员告诉 The Verge,这一点已经显现出来。
许多人描述这些论文难以理解,有时几乎无法读懂。“我最熟悉的那篇问题的论文,快速读一遍后几乎不知所云,”布朗大学的数学教授 Brendan Hassett 告诉 The Verge。“如果这是人写的,我不会再花时间去试图理解它。当然,这还剩下另外 721 篇预印本!”(Hassett 说这话时,OpenAI 尚未撤回三篇论文)。
一些研究人员告诉 The Verge,他们或同事注意到有几篇论文似乎覆盖了其他数学家已经涉足的领域,但在有机会妥善审阅材料之前,他们不愿公开这么说。另一些人则指出这些工作异常简短,通常他们预期需要数百页才能展开的结果,被压缩到了几十页甚至更少。
澳大利亚悉尼大学的数学教授 Nalini Joshi 表示,快速检索这批发布内容后,她发现与自己工作重叠的部分很少,但她指出,她查看的一些论文“参考文献很短”。鉴于此前对 OpenAI 署名做法的批评,她说她“担心论文中的署名可能缺少完整的信息”。
但尽管存在种种粗制滥造和不确定性,总体共识是,这批发布内容中包含一些确实令人印象深刻的工作。
在强调评估如此大量材料的困难——以及妥善核实结果的必要性——的同时,多位接受 The Verge 采访的研究人员表示,尽管在呈现方式上存在不足,这些工作似乎水准极高。他们说,在 AI 出现之前的世界里,OpenAI 的许多成果显然足以发表在顶级期刊上,也足以让作者获得一份学术生涯。其中少数成果被描述为那种能让一位数学家成为菲尔兹奖——该领域最高荣誉之一——有力竞争者的工作。
“我要么得去读那些可能并不正确的粗制滥造之作,要么等别人去读,要么等有人把它们形式化,然后我才能确定这些结果是否正确。”
斯坦福大学数学家 Jared Duker Lichtman 表示,他会把“数十项”成果归入这一类别,包括在黎曼猜想上取得的进展、霍奇猜想的一个特例,以及四维挂谷猜想的解决。这些都是数学领域的重大问题。黎曼——可以说是整个学科中最臭名昭著的未解难题——和霍奇都位列著名的千禧年大奖问题七题之中。它们分别关注素数的分布,以及大致说来,如何用更简单的构件来理解复杂的几何形状。而挂谷问题大致问的是,要让一根针或铅笔朝各个方向旋转,所需的空间能有多小。三维挂谷猜想的证明,正是纽约大学数学家王虹今年早些时候被授予菲尔兹奖的成果之一。
“并不是说这些只是没人听说过的无聊问题,”数学家 Scott Armstrong 说。“其中许多都是非常著名的问题,很多人已经尝试了几十年。”
随着尘埃开始落定,数学家们发现自己面对的是一片骤然改变的地貌。他们中的许多人刚刚目睹多年的工作和精心制定的研究计划瞬间化为乌有,或者认识遭遇同样命运的同行。在整个领域,无论反应中夹杂着兴奋、恐惧、绝望还是介于其间的情绪,都有一种深深的迷失感。
到第二天早上,这种情绪并没有太大改变。Armstrong 在穿过巴黎时通过电话表示,他想象如果索邦大学没有因持续的学生抗议而关闭,同事们像往常一样聚在咖啡机旁,气氛会相当“肃穆”。
在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 描述了同事和学生之间同样阴郁的气氛。她说,这场洪流感觉有些“可怕”,但在数周的不确定之后,它的到来也带来了一些解脱。“我有一大群朋友和同事的经费申请刚刚被一笔勾销,”她说。
“我有一大群朋友和同事的经费申请刚刚被一笔勾销。”
Armstrong 说,他知道有一个团队,其整个研究计划几乎被这次发布“一笔勾销”。与此同时,曾处于OpenAI 早前纳维-斯托克斯问题争议中心的纽约大学数学家 Tristan Buckmaster 表示,他已经听说“有三个人整个研究计划被彻底摧毁”。
在 The Verge 与数学家的交谈中,类似的故事反复出现,不过这种冲击主要集中在领域的某些方向。苏格兰赫瑞瓦特大学数学教授 Francesco Fournier-Facio 表示,概率论、组合学和理论计算机科学的研究者似乎“尤其震惊”,并补充说,他所在领域中的某些方向,如群论,已被“推平”。
Armstrong 和其他研究人员表示,一些领域似乎是以近乎军事级的精度被瞄准的。“确实有一些目标,”Armstrong 说。他特别指出了 Wang 今年获得菲尔兹奖所涉领域的工作,以及几个千禧年大奖难题。他说,数学物理领域的一批成果清楚表明,OpenAI 正在研究 Yang-Mills 理论——支撑现代粒子物理学大部分内容的数学框架——及其未解决的“质量间隙”问题,这是七个大奖难题之一。
在其他地方,研究人员对自己工作似乎很少被触及表达了一种惊讶的宽慰。Roney-Dougal 说,她自己所在的领域角落——主要围绕群论——似乎相对未受波及。她开玩笑说,幸好她研究的是一个“非常不时髦的领域”,不过后来发消息说,在发现自己的作品被其中一篇论文引用后,她感到“不确定”。
Joshi 同样发现与她自己的工作几乎没有重叠,她的工作主要聚焦于可积系统,即可以精确求解的复杂系统。她提出,这可能是因为她的领域较少由长期存在、正式表述的猜想和定义驱动,而更多由随着物理学发展而起伏的问题驱动。
截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因一个“符号错误”而撤下三篇论文,该错误据称使某个论证失效。
无论他们自己的工作是否受到直接影响,大多数接受 The Verge 采访的数学家都共同感到,这个领域已经跨过了某种门槛,不再是一天前的样子。高等研究院研究员 Constantin Kogler 称其为“数学史上最重要的单一时刻”,而伦敦数学科学研究所研究员 Yang-Hui He 则回溯数千年,将今年 AI 驱动的发展比作欧几里得《几何原本》的出版,这是该学科最具影响力的著作之一。
很少有研究人员的评价如此宏大,但普遍共识是,数学正在快速变化——数学家也必须随之改变。
OpenAI 知道这次发布将带来颠覆,并已做出一些努力来缓和冲击并与数学界接触。在今年早些时候与研究人员发生几次不愉快交锋后,该公司转向数学家本人寻求帮助,与新成立的数学与人工智能咨询小组(AGMAI)合作,研究如何负责任地发布这些成果。
AGMAI 已经 阐明 了它认为负责任的参与方式应该是什么样的。AI 实验室最好发布“人类能理解”的论文,或者以其他方式提供必要的“支持,以开展额外的数学活动,使人类能够理解和吸收其 AI 生成的数学成果,并识别其可能的应用”。他们表示,在可能的情况下,证明应当形式化,并且公司应当公开他们用来创建这些证明的模型和提示词。该组织还敦促 AI 实验室停止将数学发布视为“推广其模型的营销工具”,并应“停止在专有模型上测试高级数学问题”,因为这些模型对更广泛的科学界来说无法访问。
“并不是说这些只是没人听说过的无聊问题。其中许多都是非常著名的问题,许多人已经尝试了几十年。”
OpenAI 采纳了该组织的一些建议。它表示将围绕其在数学方面的工作资助一系列研讨会和会议,以帮助社区处理和理解其工作,不过它没有提供这些活动可能是什么样子或何时举行的细节。该公司还披露了比以往发布中多得多的信息——研究人员再次表示,这是一个很低的标准——包括其模型尝试了 4,000 多个问题,并且一个典型结果使用了大约三个小时的 ChatGPT Pro 思考计算。它还实施了“论文修订和引用的协议”,并在 GitHub 上表示它“将保留公开的发布历史”。截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因一个“符号错误”而撤下三篇论文,该错误据称使某个论证无效。OpenAI 没有就 The Verge 要求提供更多细节的请求做出正式回应。
这一变化解决了与数学家之间一个关键的摩擦来源,其中一些人谈到围绕该公司已发表声明的一种“偏执”。该公司有 习惯 在回应批评时暗中修改新闻稿和论文,而不明确披露这些更改。
但 OpenAI 并没有遵循该组织的所有建议——包括一些最重要的建议。它没有指明发布背后的模型,也没有披露所使用的提示词或模型尝试的完整问题集。OpenAI 似乎还承认其形式化工作有所欠缺——它表示将在获得更多形式化后添加——并且论文质量不达标,称“对于未来的发布,我们致力于通过引用、数学阐述和结果呈现来进一步提高论文质量,以便更好地理解。”
“我最了解的那个问题的写稿,快速读完后几乎说不通。”
The Verge 采访的研究人员质疑,为什么 OpenAI 不能提高这些论文的质量,并对它似乎懒得提前形式化——甚至在撤稿论文的情况下连检查都不做——许多结果表示失望。像所使用的提示词这样的信息,也会在减轻许多人感到的负担方面极为有用,即评估该公司突然抛给他们的海量材料。
最重要的是,该公司表示没有计划停止在数学问题上测试其模型,并且实际上暗示它认为这样做是一种必要之举。“我们希望直接赋予科学家最先进的能力,并正在努力负责任地发布产生这些结果的模型,”它在宣布最新结果时表示。“这就是为什么继续在数学和其他科学领域评估我们的内部前沿模型很重要,这样我们就能加速开发推动这些领域进步的工具。”
在 OpenAI 公布其成果后,AGMAI 称这一发布是“第一步”,并再次呼吁公平获取算力和研究工具。更根本的是,该组织认为“数学研究的未来不能仅仅是理解 AI 实验室产生的结果。”
尽管 OpenAI 声称解决了数百个长期存在的问题,数学家们表示还有大量工作要做。许多人估计,理解该公司刚刚发布的所有内容可能需要数学界花费数年时间。
Armstrong 将如此多新数学的突然涌现比作一次短暂的外星访问可能引发的骚动。“如果 AI 现在消失,就像外星人来到地球然后离开一样,我们会在接下来的 10 年里研究这些,试图理解一切。”
其中很多工作本身就令人兴奋。研究人员将不得不填补空白、提取有用的思想和联系,并将解决方案置于更广泛的数学背景中,而所有这些通常与为人类产生解决方案相伴而行。“对于其中许多结果,相关专家非常关心这些解决方案,我相信他们能够消化这些内容并向更广泛的世界展示,”Lichtman 说。他认为,随着 AI 改变这些领域,涉及解释、验证和情境化结果的工作需要得到更多重视。“作为一个社会,我们应该更多地奖励这些消化工作。”
可能还有大量数学工作留给人类去做。据他所知,Lichtman 说所有结果尽管“令人惊叹”,但都“来自现有的方法和技术”。它们填补了已知数学版图的部分空白,而不是创造全新的领域。“事实证明,可填补的空间比专家们之前所知道的要多得多!”Lozano-Robledo 也认同这一点:“它们都在以非常巧妙的方式使用现有技术。”
而现有的版图远非极限。“数学研究本质上是无限的,”Lozano-Robledo 说。“研究将继续下去。”伦敦研究所的 He 表示,他特别期待看到接下来会出现什么,并推测研究人员最终可能会创造出新思想,“甚至可能是新的数学领域”。
这些公司似乎准备立刻继续前进,远在数学界有任何合理机会消化它们所产生的内容之前。
《The Verge》采访的数学家中,很少有人原则上反对 AI 产生新数学。事实上,许多人对此表示欢迎,并在不同程度上表示他们自己是 AI 工具的狂热用户。大多数不安针对的是构建这些工具的 AI 公司进入他们领域的方式。
看看 OpenAI 和其他 AI 实验室发布的数学成果,你会觉得研究数学基本上就是把问题从清单上一个个划掉。AI 实验室公布结果的方式也强化了这种印象:一场炫目的发布会、一份初步的文稿,剩下的就丢给数学家去弄明白并加以阐释。多位研究人员告诉 The Verge,这些公司似乎准备立刻转向下一个目标,而学界根本还没来得及对他们产出的东西进行任何合理的消化。
研究人员形容,这是对数学研究实际运作方式的贫乏理解。解答固然重要,但通往解答过程中发生的一切同样重要:发展想法、建立联系、发现新问题或开辟其他研究路径。当 OpenAI 这样的公司只是找到答案而不做任何周边工作时,数学家们说,这些工作的负担就落回了学界身上。
“有新结果当然是好事,但这个规模是另一个层级,”波兰波兹南密茨凯维奇大学的数学家 Bartosz Naskręcki 说。“这是一团大乱,”他说。“它可能导致学术文化的巨大崩塌,直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这个问题。”
需要数年才能理解的不仅仅是数学本身。研究人员也在艰难地理解这场剧变对他们意味着什么。许多人描述,随着数学家们试图弄清自己在快速变化的领域中处于什么位置,一种黯淡、近乎存在主义式的情绪笼罩着整个学界。他们可能没有多少时间去想明白。
数学家之间已经在流传关于 OpenAI 将进一步发布成果的传闻。对于是否还有更多发布计划,OpenAI 未回应 The Verge 的提问。
Roney-Dougal 说,她害怕又一次发布——或者 Anthropic 或其他 AI 实验室加入战局的前景。
这场冲击对博士生、初级研究人员以及其他没有终身教职的人打击尤为沉重。像 OpenAI 模型正在攻克的那些开放问题,可能支撑着学位论文、经费申请、求职材料以及多年规划的研究,而这些都是学术生涯的重要基石。几位研究人员描述了一种日益普遍的焦虑:他们赖以为职业根基的工作可能突然成为下一个目标,而 AI 模型在堵死一些方向的同时,几乎没有开辟出未来探究的新路径。“对于经费即将到期或正在找工作的人来说,这极具破坏性,”瑞士苏黎世联邦理工学院的数学家 Simon Machado 说,他即将加入法国国家科学研究中心(CNRS)。
“数学研究本质上是无限的。研究仍会继续。”
士气可能格外低落,因为一切都让人感觉没完没了。OpenAI 的发现一波比一波大,中间几乎没有停顿,而且公司频繁暗示还有更多成果在路上。“你会感觉到他们并不真正在乎这些单个结果,”Roney-Dougal 说。“这种感觉真的很糟糕。”
数学家们还没来得及消化一组结果,下一组更大的结果就砸了下来。“再过两个月就会有东西把这一切彻底盖过去,”Armstrong 说。“就像是一轮又一轮越来越大的炸弹轰炸。”
Armstrong 说,他认为自己是对 AI 最热情、最乐观的数学家之一。他在自己的工作中使用这项技术,并相信它潜力巨大。但即便是他,也越来越感到不安。“晚上有点难以入睡,”他承认道。
当被问及接下来打算做什么时,Armstrong 不太确定。他仍在巴黎街头步行去吃午饭,他说自己眼下的首要任务是完成一些他一直在做的工作——有时借助 OpenAI 的 Codex——“赶在 OpenAI 抢在我们前面之前。”
除此之外,就连这位自称的 AI 乐观主义者也不确定,并质疑自己在数学领域还有怎样的未来。他尤其担心该领域的年轻研究者。“数学界接下来几年会非常诡异,”他说。
关注本报道的话题和作者,以便在个性化首页信息流中看到更多类似内容,并接收邮件更新。
- Robert Hart
来源:The Verge:AI · theverge.com