Topic · 主题全部主题 →

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

2,350条收录
119条精选

精选归档 · 第 5 页

81100 条 · 共 119

5月29日5月29日周五

星期五 · 1 条
11:29
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
Qwen-VLA:统一跨任务、环境与机器人形态的视觉-语言-动作建模

Qwen-VLA是一个统一的具身基础模型,将Qwen的视觉-语言建模从感知、理解与推理扩展至连续动作和轨迹生成。它通过基于DiT的动作解码器实现,使用包含机器人操作轨迹、人类第一人称示范、仿真及导航数据等在内的大规模数据进行联合预训练。为支持多种平台,引入了感知载体感知的提示条件机制,并将操作、导航与轨迹预测统一到一个框架中。实验显示,Qwen-VLA-Instruct在多个基准上表现优异,例如在LIBERO达到97.9%,在真实世界ALOHA实验中平均分布外成功率为76.9%。

另有 2 家信源报道公众号:通义实验室(千问)Qwen:Blog Retrieval(API)
推荐理由:Qwen-VLA 让一个模型同时搞定操作、导航和轨迹,在具身智能统一化上迈出了关键一步。虽然还停在实验室阶段,但 97.9% LIBERO 和真实世界泛化结果证明这条路走得通,做机器人的值得认真读。

5月26日5月26日周二

星期二 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
GE-Sim 2.0:面向机器人操作的全面闭环视频世界模拟器路线图

GE-Sim 2.0是一个用于机器人操作的闭环视频世界模拟器。它基于动作条件视频生成框架,并使用数千小时涵盖遥操作与接触交互等真实世界数据进行重新训练,提升了动作跟随与轨迹覆盖能力。其核心新增三个模块:从视频潜变量解码本体感受状态的“状态专家”;为生成轨迹评分并提供成功信号与奖励的“世界评判”;以及能实现快速轨迹生成的加速框架。该模型仅2B参数,在WorldArena排行榜上位列第一,优于专用模型与闭源生成器,其训练出的策略能转化为实际世界性能提升。


推荐理由:过去机器人策略训练卡在仿真到真机的鸿沟上,GE-Sim 2.0 把视频生成、状态提取和自动评估闭环了,策略迭代效率可能翻倍,搞具身智能的很值得蹲一下。

5月22日5月22日周五

星期五 · 1 条
18:09
IT之家(RSS)精选
AI 评分 74/100
国家发改委:加快具身智能训练基础设施建设,让机器人不仅能上赛场,还能"进工厂、进商场、进家庭"

国家发改委在5月22日新闻发布会上表示,人形机器人在半程马拉松比赛中表现显著提升,速度更快、更灵活、更自主,参赛队伍从20余支增至百余支,完赛队伍从6支增至40余支,反映具身智能创新活力增强和产业规模扩大。下一步,发改委将加快具身智能训练基础设施建设,推动机器人融入工厂、商场、家庭等场景,并建设应用中试基地以加速技术落地。


推荐理由:国家发改委首次明确加快具身智能训练基建,机器人从「上赛场」到「进工厂、进商场、进家庭」,这是给具身智能行业打了一针强心剂。

5月19日5月19日周二

星期二 · 4 条
18:51
IT之家(RSS)精选
AI 评分 75/100
现代汽车集团计划部署 2.5 万台波士顿动力 Atlas 人形机器人

现代汽车集团公布计划,将在现代汽车和起亚的制造工厂部署超过 2.5 万台子公司波士顿动力开发的 Atlas 人形机器人,并将在美国工厂制造核心机器人零部件。该集团目标到 2028 年实现年产 3 万台 Atlas 机器人,同时计划在美国工厂每年生产超过 30 万个执行器单元。该计划是在摩根大通主办的投资者关系会议上提出的,未提供详细推广时间表或指明具体工厂。


推荐理由:2.5万台Atlas进工厂,这规模把具身智能从炫技视频直接推进了流水线,2028年产能30万台执行器才是真正的信号,供应链的人该紧张了。
16:51
IT之家(RSS)精选
AI 评分 74/100
地平线开源 HoloMotion-1 4 亿参数机器人小脑大模型,可实现舞蹈、健身、搬箱子等动作

地平线机器人实验室发布了其开源的人形机器人全身控制模型 HoloMotion-1。这是一个拥有 4 亿参数的“小脑”大模型,通过 MoE 稀疏激活与 KV-cache 推理机制,在端侧实现了约 300FPS 的实时推理能力。该模型利用互联网视频、光学动捕、VR 遥操作等多种来源的动作数据进行训练,并在真实机器人上成功展示了舞蹈、爬行、健身、搬箱子等复杂动作的零样本迁移能力。相关代码与技术报告已公开。


推荐理由:地平线开源的这个4亿参数模型,把机器人“小脑”拉到一个小模型级别,300FPS实时跑在端侧,零样本跳舞搬箱子,搞具身智能的该跟进看看了。
12:55
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
StableVLA:无需额外数据的鲁棒视觉-语言-动作模型

视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。


推荐理由:VLA 模型在真实世界一遇到光照遮挡就崩,这篇用信息瓶颈原理做的轻量适配器,不加数据就拉回 30% 性能,还用 0.5B 小模型打平 7B,做机器人落地的团队值得看看。
00:52
Hugging Face:Blog(RSS)精选
AI 评分 67/100
NVIDIA Cosmos Predict 2.5 微调:使用 LoRA/DoRA 生成机器人视频

NVIDIA Cosmos Predict 2.5 是一个 2B 参数的世界模型,可根据文本、图像或视频片段生成物理合理的视频。通过 LoRA 或 DoRA 在 DiT 的注意力层(to_q, to_k, to_v, to_out.0)和前馈层注入可训练适配器,冻结全部基座权重,在单个 80GB GPU 上即可完成参数高效微调,避免了全量微调的高成本与灾难性遗忘。该流程使用 diffusers 和 accelerate 库,利用 92 个机器人操作视频训练集与 50 个 (prompt, image) 测试对进行微调,并展示如何用微调模型生成合成机器人轨迹以支持下游机器人学习任务。支持单 GPU 与多 GPU 训练,切换不同领域适配器无需重训。


推荐理由:这篇教程把微调Cosmos Predict 2.5的方法从头到尾讲清楚了,做机器人合成数据的同行可以直接抄作业,LoRA/DoRA切换也很方便,值得收藏。

5月16日5月16日周六

星期六 · 1 条
22:43
IT之家(RSS)精选
AI 评分 70/100
杭州基地启用,机器人有了国家级职业技能训练场

国家人工智能应用中试基地(具身智能)5月16日在浙江杭州挂牌启用,为机器人提供国家级职业技能训练场。该基地是集场景体验、技术展示、研发合作、产业赋能于一体的综合性平台,旨在推动具身智能技术从实验室迈向现实应用。杭州市于5月1日施行首部具身智能机器人地方性法规,支持核心研发、平台建设和场景开放。目前杭州已集聚机器人产业相关企业700余家,2025年具身智能产业集群产值达1068亿元。


推荐理由:杭州这个国家级具身智能训练场不是「又一个基地」,它是把散点技术拢成产业链标准化的关键一步,做机器人的可以盯着政策红利和开放场景了。

5月14日5月14日周四

星期四 · 1 条
01:29
Chubby♨️@kimmonismus精选
AI 评分 77/100
人形机器人已能自主完成8小时轮班“If AI takes your white-collar job, just move into blue-collar work.” 🤦♂️Meanwhile, blue-collar work:"如果AI抢了你的白领工作,那就转行做蓝领吧。" 🤦♂️ 与此同时,蓝领工作: 【引用 @adcock_brett】:观看一组人形机器人以人类绩效水平完成完整的8小时轮班。这是完全自主运行的Helix-02 https://x.com/i/broadcasts/1dxYljYVREYJX

Brett Adcock: Watch a team of humanoid robots running a full 8-hr shift at human performance levels. This is fully autonomous running ...


推荐理由:Kim这个反问很扎心,当Figure的机器人跑通8小时轮班时,蓝领这条退路也被封死了,对普通人的就业冲击不再是遥远的事了。

5月8日5月8日周五

星期五 · 1 条
22:50
Jim Fan@DrJimFan精选
AI 评分 79/100
机器人终局:物理AGI路线图与LLM类比I promise this will be the best 20 min you spend today! Robotics: Endgame, the sequel to my last year's Sequoia AI Ascent talk, "Physical Turing Test". I laid out the roadmap for solving Physical AGI as a simple parallel to the LLM success story. Be a good scientist, copy homework ;)And stay till the end, more easter eggs and predictions for your polymarket!00:30 DGX-1 origin story at OpenAI, I was there in 2016 signing with Jensen and Elon. Heading to the Computer History Museum! 01:42 The Great Parallel 03:31 Robotics, the Endgame 03:39 Why VLAs fall short 04:32 Video world models as the 2nd pretraining paradigm 06:09 World Action Models (WAM) 07:46 Strategies for robot data collection and the FSD equivalent to physical data flywheel for robot manipulation 11:06 EgoScale and the Dexterity Scaling Law we discovered recently 14:00 Physical RL: bridging the last mile 15:39 DreamDojo: an end-to-end neural physics engine for scaling RL in silico 17:00 Civilizational Technology Tree and my predictions for the near future. Spoiler: it's closer than you think.Thanks to my friends at Sequoia for inviting me back to AI Ascent this year! I had a blast! Last year's talk is attached in the thread if you missed it.演讲者以"Robotics: Endgame"为题,提出解决物理AGI的路线图,直接类比LLM的成功路径。核心观点包括视频世界模型作为第二预训练范式、世界行动模型(WAM)、机器人数据收集策略(类似FSD的物理数据飞轮)、EgoScale和灵巧性缩放定律、物理强化学习 bridging the last mile,以及DreamDojo端到端神经物理引擎。预测物理AGI的实现比预期更近,并提及2016年参与OpenAI DGX-1签署与Jensen和Elon的个人经历。

推荐理由:Jim Fan 这 20 分钟把机器人做成了 LLM 的平行故事,从 World Action Models 到 Dexterity Scaling Law,信息密度大到建议 0.5 倍速,做硬件的该换地图了。

5月5日5月5日周二

星期二 · 2 条
12:17
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
MolmoAct2:面向真实世界部署的动作推理模型

MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。


推荐理由:开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics,还附赠最大的双手操作数据集和全套训练代码,做机器人的同学本周必读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
RLDX-1技术报告

为提升视觉-语言-动作模型在复杂现实任务中的功能覆盖,研究团队推出通用机器人策略RLDX-1。该模型基于多流动作变换器架构,整合运动感知、记忆决策与物理传感等异构模态,并辅以合成罕见场景数据、仿人操作学习流程及实时推理优化等系统设计。在仿真与真实测试中,RLDX-1全面超越前沿模型π_{0.5}和GR00T N1.6,尤其在ALLEX人形机器人任务上取得86.8%的成功率,显著高于对照模型的约40%,标志着其在接触密集型动态灵巧操作领域取得关键进展。


推荐理由:在 ALLEX 人形任务上把成功率从 40% 拉到 86.8%,RLDX-1 证明了多模态流架构对灵巧操作的价值,做机器人的同学可以重点关注一下。

4月30日4月30日周四

星期四 · 1 条
20:12
The Decoder:AI News(RSS)精选
AI 评分 70/100
Softbank 计划将估值高达1000亿美元的新AI与机器人公司Roze上市

软银集团计划在美国启动并推动其新成立的人工智能与机器人公司Roze进行首次公开募股。据《金融时报》报道,这家新公司的估值可能高达1000亿美元。此举标志着软银在AI和机器人领域的重大战略布局,旨在将相关业务整合并独立上市以获取市场资源与更高估值。


推荐理由:软银千亿美元估值的AI机器人公司Roze计划IPO,是今年AI领域最大的资本动作。如果成功,将重塑整个具身智能赛道的投资逻辑,值得持续关注。

4月28日4月28日周二

星期二 · 2 条
13:33
IT之家(RSS)精选
AI 评分 71/100
新增具身智能、脑机科学与技术等 38 种专业,教育部发布 2026 年本科专业目录

教育部发布《普通高等学校本科专业目录(2026年)》,新增38种本科专业,目录现涵盖13个门类、883种专业。为适应新兴交叉学科发展,目录在“交叉学科”门类中首批列入未来机器人、具身智能、脑机科学与技术等15种专业。新增专业精准对接国家战略与产业需求,包括能源科学与工程、深地科学与工程、农业机器人、生物制造、数字文旅、商业人工智能等。其中,具身智能专业获哈尔滨工业大学等9所高校增设。“十四五”期间全国高校专业调整幅度超30%,今年调整比例首次突破10%。


推荐理由:教育部把具身智能列为本科专业,9所高校首批开设,这是AI人才供给端的结构性信号。做具身智能的团队,未来几年招人会容易很多。
08:28
Hugging Face:Blog(RSS)精选
AI 评分 58/100
Adaptive Ultrasound Imaging with Physics-Informed NV-Raw2Insights-US AI

NVIDIA 在 Hugging Face 上发布了一款名为 NV-Raw2Insights-US 的物理信息人工智能模型,专门用于自适应超声成像。该模型能够直接处理原始超声射频数据,实时生成高质量的诊断图像。它通过结合物理定律与深度学习,显著提升了图像分辨率和对比度,同时将传统处理流程中的多个步骤整合为单一前向传播,大幅提高了计算效率。这一进展有望推动超声设备向更便携、智能和精准的方向发展。


推荐理由:NVIDIA 把物理先验塞进超声成像管线,从原始射频数据直接出诊断结果,跳过传统重建步骤。做医疗 AI 的值得拆一下这个端到端思路,但离通用场景太远。

4月23日4月23日周四

星期四 · 1 条
09:08
IT之家(RSS)精选
AI 评分 72/100
Model S/X 产线将为特斯拉 Optimus 机器人让路,最早 7 月投产

特斯拉CEO马斯克确认,Optimus人形机器人将于7月下旬或8月在弗里蒙特工厂投产。为此,Model S和X的生产线将在5月上旬停产后被彻底拆除,并在4个月内切换为Optimus生产线,马斯克称此速度“快得惊人”。Optimus涉及超10000个独特零部件,初期产量将“相当缓慢”,难以预测。此外,得州超级工厂的第二座Optimus工厂预计2027年夏季投产,将生产第四代机型。原定2026年第一季度亮相的第三代Optimus可能推迟至今年年中发布。


推荐理由:Optimus 在弗里蒙特投产是具身智能从 demo 走向真量产的关键一步,产线 4 个月切换的工程魄力比产量数字更值得关注。

4月14日4月14日周二

星期二 · 1 条
23:33
Google DeepMind:Blog(RSS)精选
AI 评分 68/100
Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

另有 3 家信源报道X:Google DeepMind (@GoogleDeepMind)X:Rohan Paul (@rohanpaul_ai)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。

4月1日4月1日周三

星期三 · 1 条
23:03
Jim Fan@DrJimFan精选
CaP-X开源发布:大模型智能体进入物理世界The power of the Claw, in the palm of a robot hand. Agentic robotics is here! Today, we open-source CaP-X: vibe agents, alive in the physical world. They incarnate as robot arms and humanoids with a rich set of perception APIs, actuation APIs, and auto synthesize skill libraries as they go. CaP-X is a strict superset of our old stack, because policies like VLAs are “just” API calls as well. It solves many tasks zero-shot that a learned policy would struggle with.And we are doing much more than vibing. CaP-X is our most systematic, scientific study on agentic robotics so far:• We build a comprehensive agentic toolkit: perception (SAM3 segmentation, Molmo pointing, depth, point cloud), control (IK solvers, grasp planner, navigation), and visualization (EEF, mask overlays) that work across different robots. • CaP-Gym: LLM’s first Physical Exam! 187 manipulation tasks across RoboSuite, LIBERO-PRO, and BEHAVIOR. Tabletop, bimanual, mobile manipulation. Sim and real. Can’t wait to see the gradients flow from CaP-Gym to the next wave of frontier LLM releases. • CaP-Bench: we benchmark 12 frontier LLMs/VLMs (Gemini, GPT, Opus, Qwen, DeepSeek, Kimi, and more) across 8 evaluation tiers. We systematically vary API abstraction level, agentic harness, and visual grounding methods. Lots of insights in our paper. • CaP-Agent0: a training-free agentic harness that matches or exceeds human expert code on 4 out of 7 tasks without task-specific tuning. • CaP-RL: if you get a gym, you get RL ;). A 7B OSS model jumps from 20% to 72% success after only 50 training iterations. The synthesized programs transfer to real robots with minimal sim-to-real gap.3 years ago, our team created Voyager, one of the earliest agentic AI that plays and learns in Minecraft continuously. Its key ideas — skill libraries, self-reflection loops, and in-context planning — have since influenced many modern agentic designs.Today, the agent graduates from Minecraft and gets a real job. It’s April Fool’s, but this Claw is getting its hands dirty for real!Link in thread:CaP-X开源具身智能系统,让大模型智能体通过机械臂与人形机器人进入物理世界。系统整合SAM3、Molmo等感知API与IK求解器、抓取规划等控制接口,可自动合成技能库。研究发布CaP-Gym基准(187项操作任务)与CaP-Bench(评测12个前沿模型),提出零样本框架CaP-Agent0及强化学习方案CaP-RL,后者仅用50次迭代即将7B模型成功率从20%提升至72%。该技术由曾开发Minecraft智能体Voyager的团队推出。

推荐理由:NVIDIA Jim Fan 开源 CaP-X,让 Vibe Agent 真正进入物理世界操作机器人

3月10日3月10日周二

星期二 · 2 条