奥特曼用教授到顶尖学者类比 GPT-5.5 到后 Astra

AYi · @AYi_AInotes · X·2026-09-17 12:03·6小时前
AI 导读

奥特曼在 Dreamforce 对话中把 GPT-5.5 到后 Astra 的能力差距换算成人类学者代差:5.5 相当于普通数学教授,5.6 是前 2% 顶尖学者,Astra 再高半档,内部研发中的后 Astra 目标则是做到世界上最优秀数学家都做不到的事。

AYi@AYi_AInotes
39AI 编辑部评分,满分 100

奥特曼用教授到顶尖学者类比 GPT-5.5 到后 Astra

2026-09-17 12:03· 6小时前
AI 导读

奥特曼在 Dreamforce 对话中把 GPT-5.5 到后 Astra 的能力差距换算成人类学者代差:5.5 相当于普通数学教授,5.6 是前 2% 顶尖学者,Astra 再高半档,内部研发中的后 Astra 目标则是做到世界上最优秀数学家都做不到的事。

以前听大模型吹能力,比的是刷榜跑分;这次奥特曼在 Dreamforce 算账,直接把 GPT-5.5 到后 Astra 换算成了普通教授到顶尖学者的代差。

他在对话里排得极其具象:5.5 相当于普通数学教授,5.6 是前百分之二的顶尖学者,Astra 再高半档,而内部研发中的后 Astra,目标是做到世界上最优秀数学家都做不到的事。

大模型行业终于厌倦了在已知题库上卷小数点,真正值钱的座标体系,正在从刷分变成推演深度的硬碰硬。

跑分早已被各种微调策略刷穿了,但数学不同。只要接上严密的形式化验证环境,机器每走一步都有编译器即时核验对错,这种强化学习环境成了大模型最干净的深潜跑道;人类学者耗费半年推导的一条分支,模型靠算力可以在成千上万个公理组合里飞速试错。

真正让我觉得有意思的是,以前是拿 AI 去适配人类的考试,现在变成拿顶尖人类智力当尺子,去量机器在形式科学里走出了多远。

但这里必须看清边界:能走出人类推不动的证明步骤,并不意味着模型懂得了数学的意义。

它能在规则分明的迷宫里用算力排雷,却无法凭空创造一套全新的数学审美,更不知道哪一个猜想对人类未来至关重要。

未来变得不值钱的,是在已知框架里靠人力堆砌的繁重验算;而变得更稀缺的,是知道把目光望向哪个全新命题的直觉。

工具可以把证明推向人类未曾抵达的盲区,但决定把手电筒照向哪座山峰的,依然是人类自己。 https://x.com/rohanpaul_ai/status/2100144714251198466/video/1

来源:AYi· x.com