以前听大模型吹能力,比的是刷榜跑分;这次奥特曼在 Dreamforce 算账,直接把 GPT-5.5 到后 Astra 换算成了普通教授到顶尖学者的代差。
他在对话里排得极其具象:5.5 相当于普通数学教授,5.6 是前百分之二的顶尖学者,Astra 再高半档,而内部研发中的后 Astra,目标是做到世界上最优秀数学家都做不到的事。
大模型行业终于厌倦了在已知题库上卷小数点,真正值钱的座标体系,正在从刷分变成推演深度的硬碰硬。
跑分早已被各种微调策略刷穿了,但数学不同。只要接上严密的形式化验证环境,机器每走一步都有编译器即时核验对错,这种强化学习环境成了大模型最干净的深潜跑道;人类学者耗费半年推导的一条分支,模型靠算力可以在成千上万个公理组合里飞速试错。
真正让我觉得有意思的是,以前是拿 AI 去适配人类的考试,现在变成拿顶尖人类智力当尺子,去量机器在形式科学里走出了多远。
但这里必须看清边界:能走出人类推不动的证明步骤,并不意味着模型懂得了数学的意义。
它能在规则分明的迷宫里用算力排雷,却无法凭空创造一套全新的数学审美,更不知道哪一个猜想对人类未来至关重要。
未来变得不值钱的,是在已知框架里靠人力堆砌的繁重验算;而变得更稀缺的,是知道把目光望向哪个全新命题的直觉。
工具可以把证明推向人类未曾抵达的盲区,但决定把手电筒照向哪座山峰的,依然是人类自己。 https://x.com/rohanpaul_ai/status/2100144714251198466/video/1