Topic · 主题全部主题 →

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

2,340条收录
119条精选

最新精选

120 条 · 共 119

8月22日

星期六 · 1 条
22:24
IT之家(RSS)精选
AI 评分 71/100
第二届世界人形机器人运动会开幕:2056 台机器人齐聚"冰丝带",666 支队伍竞技 51 赛项

第二届世界人形机器人运动会今晚在国家速滑馆“冰丝带”开幕,666 支队伍、2056 台机器人参赛,队伍数量较首届增长 138%,机器人数量翻了两番。天工 Ultra 在百米预赛跑出 9.39 秒,打破博尔特 9.58 秒的人类世界纪录;荣耀“闪电”以 41.95 秒完成 400 米,同样破人类纪录。本届赛项增至 51 项,多项竞技赛取消人工遥控,全程全自主运行。


推荐理由:百米成绩从首届的 21.50 秒跃升到 9.39 秒,且多项赛项取消人工遥控,这场赛事开始检验机器人在真实环境中的自主运动与决策,而不只是展示预编程动作。

8月17日

星期一 · 1 条
21:22
IT之家(RSS)精选
AI 评分 73/100
A 股迎来"人形机器人第一股",宇树科技官宣 8 月 19 日科创板上市

宇树科技宣布股票将于 2026 年 8 月 19 日在科创板上市,发行价 150.80 元/股,对应市值约 609.93 亿元,预计募资约 60.99 亿元。该公司 2023 至 2025 年营收分别为 1.59 亿元、3.93 亿元和 16.99 亿元,净利润分别为-1114.51 万元、9547.47 万元和 2.78 亿元,是全球少数实现盈利的高性能通用机器人公司。


推荐理由:宇树募资近半投向智能机器人模型研发,且 2025 年扭亏为盈,资本配置的重心正从硬件本体转向模型能力。

8月11日

星期二 · 1 条
12:58
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
RynnValue:用时间距离扩展机器人价值基础模型

RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。


推荐理由:用时间距离替代偏好标注,让价值模型能利用原始时间戳规模化训练,跨具身、任务和视角的泛化能力为无偏好数据的机器人策略提供了新的奖励接口。

8月10日

星期一 · 1 条
07:11
IT之家(RSS)精选
AI 评分 71/100
宇树科技今日启动申购,A 股迎来"人形机器人第一股"

宇树科技8月10日正式启动申购,发行价150.80元/股,对应市值约609.93亿元,拟公开发行4044.64万股,预计募资总额约60.99亿元。发行市盈率219.23倍,战略配售获配808.9286万股,包括社保基金、深度求索、中国石油集团等。2023年至2025年营收分别为1.59亿元、3.93亿元和16.99亿元,净利润于2025年达2.78亿元。

另有 1 家信源报道IT之家(RSS)
推荐理由:宇树上市募资近半投向 AI 模型研发,制造基地仅占部分,是 A 股首家以软件而非产能为融资重点的机器人公司,可能影响后续硬件企业的估值参照。

8月8日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 78/100
Ego-OSCAR:开源低成本头戴式立体惯性采集系统

Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。


推荐理由:Ego-OSCAR 把以我为中心的数据采集成本从数万美元压到200美元以下,附带标注的550小时数据集让分布式众包采集变得可行,小团队也能启动规模实验。

8月6日

星期四 · 2 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。


推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
20:10
IT之家(RSS)精选
AI 评分 71/100
宇树科技科创板发行价定为 150.8 元/股,市盈率 219.23 倍高于行业平均

宇树科技公告科创板首次公开发行定价 150.80 元/股,发行 4044.6434 万股,对应上市市值约 609.93 亿元。发行市盈率 219.23 倍,高于行业平均的 38.56 倍,预计募资总额约 60.99 亿元。战略配售获配 808.9286 万股,包括社保基金、深度求索、中国石油集团等,网上申购日为 8 月 10 日。

另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)
推荐理由:发行市盈率 219 倍是行业平均的近 6 倍,为评估当前具身智能赛道的融资热度提供了一个具体的估值参照。

8月5日

星期三 · 1 条
19:08
IT之家(RSS)精选
AI 评分 73/100
华为谈自动驾驶系统强制性国家标准发布,引望国内首批完成 L3 车型准入试点验证

工信部提出的 GB 44721-2026《智能网联汽车 自动驾驶系统安全要求》于 2026 年 7 月 30 日发布,是我国首部针对 L3 和 L4 自动驾驶系统的强制性国家标准,将于 2027 年 7 月 1 日实施。


推荐理由:强制标准为L3量产提供法规基础,引望将百亿公里数据转化为标准条款,可能影响认证技术路线。

8月4日

星期二 · 2 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
19:07
IT之家(RSS)精选
AI 评分 71/100
工信部发布首部L3/L4自动驾驶系统安全要求强制性国标,2027年7月实施

工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721—2026)强制性国家标准获批发布,拟于2027年7月1日起实施。这是我国首部针对L3级有条件自动驾驶和L4级高度自动驾驶系统的强制性国标,由2024年推荐性国标GB/T 44721—2024升级而来,为自动驾驶产品明确了统一的安全准入基线。

另有 1 家信源报道IT之家(RSS)
推荐理由:国标从推荐性转为强制性,自动驾驶产品安全准入从弹性标准变成硬性门槛,研发和测试流程需对照新基准重新校准。

7月31日

星期五 · 1 条
10:52
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
PhiZero:围绕"物理语言"构建的世界模型

PhiZero 是一种基于“物理语言”的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。


推荐理由:这不是又一个视频生成模型,它把物理世界的变化压缩成一种「物理语言」再推演,让世界模型第一次有了显式的推理步骤。在物理一致性上甩开 SOTA 一截,做具身和机器人的值得细读。

7月30日

星期四 · 3 条
23:27
Google DeepMind:Blog(RSS)精选
AI 评分 60/100
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。

另有 4 家信源报道X:Google AI for Developers (@googleaidevs)IT之家(RSS)Ars Technica:AI(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
23:16
Google DeepMind@GoogleDeepMind精选
AI 评分 71/100
Google DeepMind 发布 Gemini Robotics 2 物理 AIOne brain. For any robot. 🤖We’re launching Gemini Robotics 2: our next-generation physical AI bringing full body intelligence to humanoids, advanced dexterity, multi-robot teamwork and more.One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。
另有 7 家信源报道X:Google AI (@GoogleAI)MarkTechPost(RSS)Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)The Decoder:AI News(RSS)The Verge:AI(RSS)X:Kim (@kimmonismus)
推荐理由:这是谷歌把通用大模型能力注入机器人的关键一步,全身智能和灵巧操作如果能兑现,制造业的自动化想象会彻底改写。
20:56
The Decoder:AI News(RSS)精选
AI 评分 72/100
FCC 禁止进口中国新型机器人与联网逆变器

美国 FCC 自 7 月 28 日起禁止进口中国新型“先进机器人设备”和联网电源逆变器,理由包括防止供应链中断、数据窃取和网络攻击。禁令覆盖几乎所有重量超 2 公斤、具备无线连接和感知能力的软件控制地面机器人,但已上市型号不受影响。


推荐理由:禁令范围超出预期,连扫地机器人都在列,而且豁免审核不问安全只看产地,这是一次把供应链安全而非技术安全性放在首位的监管信号,所有依赖中国硬件的 AI 公司都该重新评估风险。

7月24日

星期五 · 2 条
23:25
Anthropic:Research(发表成果 · 网页)精选
AI 评分 73/100
Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。


推荐理由:Anthropic首次公开AI端到端控制无人机执行监视任务,Fable 5仅因3D重建瑕疵未能全通。六个月内模型一致性突飞猛进,安全压力比技术潜力更紧迫。
14:50
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
FLUX 3 x mimic:新一代视频动作模型

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

另有 5 家信源报道MarkTechPost(RSS)IT之家(RSS)X:Deedy Das (@deedydas)X:Emad Mostaque (@EMostaque)The Decoder:AI News(RSS)
推荐理由:Flux 3 证明了一个基础模型能同时生成视频和驱动机器人,Audi 产线的真实部署验证了物理 AI 从实验室走向量产,是基础模型走向通用世界理解的扎实一步。

7月23日

星期四 · 1 条
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 68/100
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

另有 1 家信源报道公众号:龙猫LongCat(美团)
推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。

7月22日

星期三 · 2 条
21:00
NVIDIA Blog(RSS)精选
AI 评分 60/100
NVIDIA 开源首个 GPU 加速医疗物理仿真框架

NVIDIA 宣布开源 Medical Physics Simulation 框架,这是 Isaac for Healthcare 中首个 GPU 加速的医疗物理仿真能力。该框架可并行运行 8,192 个机器人训练环境,将训练时间从超过 5 小时缩短至不到 2 分钟。CMR Surgical、Johnson & Johnson MedTech 等机构已在使用该框架。


推荐理由:首个 GPU 加速的开源医疗物理仿真框架,能把数千个训练环境并行跑,把训练从五小时压到两分钟,做手术机器人的团队可以直接拿来用,但对通用 AI 从业者影响不大。
12:49
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 83/100
ABot-World-0:单张桌面级GPU实现无限交互式世界生成

ABot-World-0是一个动作条件视频世界模型,能在单张NVIDIA RTX 5090 GPU上以720P分辨率、最高16 FPS、1.2秒动作到首帧延迟和约19 GiB峰值显存预算运行无限交互式世界生成。该模型采用统一的帧同步键盘动作接口,通过LongForcing分布匹配阶段解决长程自回归漂移问题,并集成轻量级VAE解码器、低比特DiT推理和局部上下文KV缓存等系统级优化。


推荐理由:在单张 RTX 5090 上实现 720P 16FPS 交互世界滚动,从数据闭环、训练到部署全栈打通。LongForcing 对长程漂移的缓解思路对做仿真和具身智能的人参考价值很大。

7月21日

星期二 · 1 条
00:49
Hugging Face:Blog(RSS)精选
AI 评分 70/100
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。


推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。