宇树开源通用人形基座大模型 UnifoLM-WLA-1.0

AYi · @AYi_AInotes · X·2026-09-12 01:00·46分钟前
AI 导读

宇树全面开源通用人形基座大模型 UnifoLM-WLA-1.0,6B 参数,用同一套权重打通底盘导航、全身移动和桌面毫米级操作。模型支持两指夹爪到五指灵巧手的跨末端自适应,策略推理延迟压到 106 毫秒,底座用 Qwen3-VL-4B 加 MMDiT 动作流专家,训练用了约 2500 小时真机多任务数据,代码、权重、数据链路和真机部署指南全部开源。

AYi@AYi_AInotes
57AI 编辑部评分,满分 100

宇树开源通用人形基座大模型 UnifoLM-WLA-1.0

2026-09-12 01:00· 46分钟前
AI 导读

宇树全面开源通用人形基座大模型 UnifoLM-WLA-1.0,6B 参数,用同一套权重打通底盘导航、全身移动和桌面毫米级操作。模型支持两指夹爪到五指灵巧手的跨末端自适应,策略推理延迟压到 106 毫秒,底座用 Qwen3-VL-4B 加 MMDiT 动作流专家,训练用了约 2500 小时真机多任务数据,代码、权重、数据链路和真机部署指南全部开源。

6B 参数、2500 小时真机实测数据、64 项复杂任务,全部塞进同一套权重里直接开源,

看来宇树不只是一家卖机器人的硬件厂,他们刚放出的这个 UnifoLM-WLA,正在把最核心的具身大脑打成白菜价,

做具身智能的人都懂行业里最难言的痛处: 外面宣传吹得天花板乱坠,实际工程里全在搞特异性打补丁, 走路用一套强化学习,抓杯子切另一套扩散模型,一旦把二指夹爪换成五指灵巧手,前面的算法几乎瞬间报废。

宇树刚刚全面开源的通用人形基座大模型(UnifoLM-WLA-1.0),直接把这道卡了全行业几年的死穴给强行干穿了:

它最狠的突破不是模型刷分,而是这三项极其冷血的工业级泛化:

1️⃣ 单一权重通吃全身协同: 彻底抛弃了“小脑管走路、大脑管抓取”的割裂拼装。这套 6B 基础模型用同一套权重,把底盘导航、全身大范围移动和桌面毫米级操作焊死在了一起,厨房端茶、端脏衣服进洗衣机,全是一模驱动; 2️⃣ 跨末端执行器的恐怖泛化: 这是真正的技术分水岭——不管前端装的是廉价的两指夹爪,还是极其复杂的五指仿生灵巧手,模型不用全盘重训,在统一表征下全部自适应跑通; 3️⃣ 真正的端侧实时闭环: 看视频右侧的终端监控,头部与双腕双目立体视觉注入,策略推理延迟直接压到了 106 毫秒(Sub-110ms)。没有云端往返的延迟卡顿,动作才能做到像生物一样的流畅咬合。

底座用 Qwen3-VL-4B 做空间常识推理,外挂 MMDiT 动作流专家, 硬生生啃下了约 2500 小时的高质量真机多任务数据。

更具杀伤力的是他们的姿态: 海外很多团队把具身算法当成融资壁垒死死藏着, 而宇树直接把代码、模型权重和数据链路全部开源(甚至附带了完整的真机部署指南)。

做机器人硬件是把骨肉做扎实, 而把具身基座做成开源基建,才是真正要把整个物理 AGI 时代往前强推一步的狠活。