LeCun 团队揭示强化学习几何盲区

AYi · @AYi_AInotes · X·2026-09-17 16:21·38分钟前
AI 导读

LeCun 团队研究发现,主流强化学习算法默认欧几里得空间,用平面几何规划动作,导致机器人在物理世界中频繁出现穿墙、瞬移等物理幻觉。团队拆解 JEPA 世界模型后发现,模型自发构建的是带方向性的高维非欧空间(拟度量流形),而非扁平地图。研究者将价值函数等价约束为潜在空间中的几何准距离,让动作规划沿流形测地线进行,样本学习效率呈数量级提升。

AYi@AYi_AInotes
36AI 编辑部评分,满分 100

LeCun 团队揭示强化学习几何盲区

2026-09-17 16:21· 38分钟前
AI 导读

LeCun 团队研究发现,主流强化学习算法默认欧几里得空间,用平面几何规划动作,导致机器人在物理世界中频繁出现穿墙、瞬移等物理幻觉。团队拆解 JEPA 世界模型后发现,模型自发构建的是带方向性的高维非欧空间(拟度量流形),而非扁平地图。研究者将价值函数等价约束为潜在空间中的几何准距离,让动作规划沿流形测地线进行,样本学习效率呈数量级提升。

人类花了数十亿美元试图教机器人理解物理世界, 结果机器人总是在关键时刻动作变形,在现实里不是动作僵硬,就是频频出现匪夷所思的物理幻觉。

@ylecun LeCun 团队最近交出的这份研究论文, 就像深水炸弹一样,把整个机器人控制领域十几年的遮羞布给炸飞了: 不是 AI 智商不够学不会物理, 而是几十年来我们所用的主流强化学习算法,一直在逼着一个早已看穿真实曲率的大脑,用一张平面的纸地图去强行导航三维地球!

看懂这场底层的几何革命,你会发现它切中了困扰具身智能最深的一根刺:

1️⃣ 传统强化学习的致命盲区:假设世界是“平直”的: 几乎所有经典的 RL 和动作规划算法,都在潜意识里默认内部空间是简单的欧几里得直线($$L_2$$ 距离)—— 算法以为从 A 点到 B 点,只要两个状态在向量空间里看起来相似,连一条直线就是最短路径。 但在真实的物理世界里,这纯属灾难: 比如隔着一堵透明玻璃墙,视觉上看起来只差 1 厘米,物理上却隔着一整道不可逾越的鸿沟; 算法以为走直线就能跨过去,于是机器人开始疯狂产生穿墙、瞬移、甚至对抗动力学的荒唐幻觉;

2️⃣ 物理世界从来不是对称的: 平面几何里从 A 到 B 的距离永远等于从 B 到 A;

但物理现实充满了不可逆的单向摩擦——从桌子跳到地上只要半秒,从地面跳回桌子可能需要搬梯子。

LeCun 团队深入拆解了自家的 JEPA 世界模型内部,发现了一个令人震惊的事实: 模型在经过大量物理交互自我学习后,在大脑深处根本没有建立扁平的地图, 它为自己自发构建的,是一个高度扭曲、带方向性、充满曲率的高维非欧空间(拟度量 Quasimetric 流形)! 过去,每当机器人试图做一个动作时,人类算法都在用平直的欧氏几何暴力碾压这个弯曲空间, 机器人实际上每天都在跟自己的大脑死磕互搏;

3️⃣ 最聪明的破局:停止对抗,顺着大脑的形状去规划: 研究人员做了一件极其性感的事——他们彻底放弃了在弯曲流形上强画直线的蠢办法!

他们直接重构了表征空间,将强化学习到达目标的真实代价(Value Function),在数学上直接等价约束为潜在空间内部的几何准距离(Quasimetric Distance)。

不再需要大模型在梦境里一帧一帧生成昂贵的像素动画, 动作规划直接顺着流形自然的几何测地线(Geodesic)平滑滑行;

4️⃣ 带来的质变是降维打击级的: 机器人不再幻想那些不可能的物理规律, 因为在它的数学世界里,那堵墙在几何上被自然定义为无限远;

避障、抓取、复杂受力操作变得如同水流绕过石头一样自然顺滑,样本学习效率直接呈数量级飙升。

这场研究给全行业最深的一层启发是: 我们总以为大模型不懂物理常识,花了海量算力试图把人类的规则硬塞给它;

但拆开潜在空间才发现,大模型其实早就凭借直觉,在数学底层摸清了物理世界那些不可逆、带阻抗的真实曲率。

错的从来不是物理世界,也不是 AI 的理解能力; 错的是人类长期以来,非要把自己习惯的平直尺子,强加在一具本该顺水推舟的高维灵魂之上。

来源:AYi· x.com