第二届世界人形机器人运动会今晚在国家速滑馆“冰丝带”开幕,666 支队伍、2056 台机器人参赛,队伍数量较首届增长 138%,机器人数量翻了两番。天工 Ultra 在百米预赛跑出 9.39 秒,打破博尔特 9.58 秒的人类世界纪录;荣耀“闪电”以 41.95 秒完成 400 米,同样破人类纪录。本届赛项增至 51 项,多项竞技赛取消人工遥控,全程全自主运行。
具身智能
AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。
最新精选
第 1–20 条 · 共 119 条
8月22日
8月17日
宇树科技宣布股票将于 2026 年 8 月 19 日在科创板上市,发行价 150.80 元/股,对应市值约 609.93 亿元,预计募资约 60.99 亿元。该公司 2023 至 2025 年营收分别为 1.59 亿元、3.93 亿元和 16.99 亿元,净利润分别为-1114.51 万元、9547.47 万元和 2.78 亿元,是全球少数实现盈利的高性能通用机器人公司。
8月11日
RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。
8月10日
宇树科技8月10日正式启动申购,发行价150.80元/股,对应市值约609.93亿元,拟公开发行4044.64万股,预计募资总额约60.99亿元。发行市盈率219.23倍,战略配售获配808.9286万股,包括社保基金、深度求索、中国石油集团等。2023年至2025年营收分别为1.59亿元、3.93亿元和16.99亿元,净利润于2025年达2.78亿元。
另有 1 家信源报道IT之家(RSS)8月8日
Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。
8月6日
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
宇树科技公告科创板首次公开发行定价 150.80 元/股,发行 4044.6434 万股,对应上市市值约 609.93 亿元。发行市盈率 219.23 倍,高于行业平均的 38.56 倍,预计募资总额约 60.99 亿元。战略配售获配 808.9286 万股,包括社保基金、深度求索、中国石油集团等,网上申购日为 8 月 10 日。
另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)8月5日
工信部提出的 GB 44721-2026《智能网联汽车 自动驾驶系统安全要求》于 2026 年 7 月 30 日发布,是我国首部针对 L3 和 L4 自动驾驶系统的强制性国家标准,将于 2027 年 7 月 1 日实施。
8月4日
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721—2026)强制性国家标准获批发布,拟于2027年7月1日起实施。这是我国首部针对L3级有条件自动驾驶和L4级高度自动驾驶系统的强制性国标,由2024年推荐性国标GB/T 44721—2024升级而来,为自动驾驶产品明确了统一的安全准入基线。
另有 1 家信源报道IT之家(RSS)7月31日
PhiZero 是一种基于“物理语言”的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。
7月30日
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
另有 4 家信源报道X:Google AI for Developers (@googleaidevs)IT之家(RSS)Ars Technica:AI(RSS)X:Testing Catalog (@testingcatalog)美国 FCC 自 7 月 28 日起禁止进口中国新型“先进机器人设备”和联网电源逆变器,理由包括防止供应链中断、数据窃取和网络攻击。禁令覆盖几乎所有重量超 2 公斤、具备无线连接和感知能力的软件控制地面机器人,但已上市型号不受影响。
7月24日
Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。
另有 5 家信源报道MarkTechPost(RSS)IT之家(RSS)X:Deedy Das (@deedydas)X:Emad Mostaque (@EMostaque)The Decoder:AI News(RSS)7月23日
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。
另有 1 家信源报道公众号:龙猫LongCat(美团)7月22日
NVIDIA 宣布开源 Medical Physics Simulation 框架,这是 Isaac for Healthcare 中首个 GPU 加速的医疗物理仿真能力。该框架可并行运行 8,192 个机器人训练环境,将训练时间从超过 5 小时缩短至不到 2 分钟。CMR Surgical、Johnson & Johnson MedTech 等机构已在使用该框架。
ABot-World-0是一个动作条件视频世界模型,能在单张NVIDIA RTX 5090 GPU上以720P分辨率、最高16 FPS、1.2秒动作到首帧延迟和约19 GiB峰值显存预算运行无限交互式世界生成。该模型采用统一的帧同步键盘动作接口,通过LongForcing分布匹配阶段解决长程自回归漂移问题,并集成轻量级VAE解码器、低比特DiT推理和局部上下文KV缓存等系统级优化。
7月21日
NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。