NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

MarkTechPost(RSS)·2026-08-05 16:25·46天前·Asif Razzaq
AI 导读

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

MarkTechPost(RSS)
精选
79AI 编辑部评分,满分 100

NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

2026-08-05 16:25· 46天前· Asif Razzaq
AI 导读

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

推荐理由

轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。

正文 · AI 翻译

NVIDIA 发布了 Alpamayo 2 Super,这是一个 34B 参数的视觉-语言-动作(VLA)模型,面向自动驾驶,采用开放商业许可。其既定设计目标是长尾事件:即传统检测与预测堆栈处理不佳的罕见多智能体场景。该模型将一个 32B VLM 主干(基于 NVIDIA Cosmos 3 Super Reasoner 构建,并通过强化学习进行后训练)与一个 2.3B 的基于扩散模型的动作解码器配对。通过对全向环视摄像头视频进行一次处理,它即可输出规划轨迹、该轨迹的因果解释以及一个元动作。

它可以部署吗

可以,而且从第一天起就可用于商业用途。权重以 OpenMDW-1.1 发布,这是 Linux 基金会针对开放模型分发的宽松许可证;源代码采用 Apache 2.0。该许可证涵盖微调、衍生模型和商业再分发。NVIDIA 正在将 OpenMDW 应用于整个 Alpamayo 系列,因此此前为研发而推出的版本现在无需额外许可即可商业部署。

输入、输出与训练数据

输入为多摄像头 RGB 视频、文本以及带时间戳的自运动历史。经过验证的公开 notebook 配置使用六个摄像头,每个摄像头四帧历史帧。自运动为 3D 平移加上一个 3×3 旋转矩阵,多时间步。

轨迹 API 返回 64 个路点,覆盖 0.1 至 6.4 秒,间隔为 0.1 秒。每个路点携带自车坐标系 XYZ 和一个 3×3 旋转矩阵。

训练数据约为 115,000 小时的多摄像头驾驶视频,附带自车运动与轨迹标注。其中包含约 3,700,000 条因果链(Chain-of-Causation,CoC)轨迹——即对驾驶决策的结构化、因果关联解释。图像训练数据超过十亿张图像。

基准测试

LingoQA 上,Alpamayo 2 Super 取得 79.2 的 Lingo-Judge 分数,在近 40 个受评估模型中排名第一。在 NVIDIA 的测试中,它比 Qwen2.5-VL 72B 高出 17.0 分,比 Gemini 2.5 Pro 高出 15.1 分,比 GPT-4o 高出 23.2 分。

还有两个数字对规划工作很重要。使用 AlpaSimPhysicalAI-AV-NuRec 数据集的 910 个场景上进行闭环评估,得到 AlpaSim 分数为 1.50 ± 0.13。在 PhysicalAI-AV 数据集的 937 个挑战性样本上进行开环评估,6.4 秒处的 minADE₆ 为 0.911m。

一个模型产生五种输出

对于每一种驾驶情境,该模型都会生成一条轨迹、一条解释决策的 CoC 轨迹、一个诸如让行或变道之类的元动作、推理自动标注,以及带 2D 定位的视觉问答。

这种组合正是该发布在运营层面引人关注的原因。开发者可以将模型观察到的内容与其选择的动作关联起来。CoC 轨迹可与 NVIDIA Halos 安全验证工作流集成,并支持符合 ISO/PAS 8800 的 AI 安全。

NVIDIA 表示,将其用作专有车队数据的自动标注器时,该模型可将标注周期从数月压缩至数天。

交互式讲解

核心要点

  • 34B VLA 模型——32B Cosmos 3 Super Reasoner 主干网络加上一个 2.3B 扩散动作专家。
  • OpenMDW-1.1 权重与 Apache 2.0 代码;允许商业使用和再分发,无需额外许可。
  • LingoQA Lingo-Judge 79.2,在近 40 个模型中排名第一;AlpaSim 1.50 ± 0.13;6.4s 时 minADE₆ 0.911m。
  • 一次前向推理即可产出轨迹、因果链(Chain-of-Causation)轨迹、元动作、自动标注以及有依据的 VQA。
  • 云端规模模型在 1× H100 80GB 上测试,峰值 72,115 MiB;可将其蒸馏用于车载推理。

查看NVIDIA 博客Hugging Face 模型卡另外,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+ 成员的 ML SubReddit,并订阅我们的新闻通讯。等等!你在 Telegram 上吗?现在你也可以在 Telegram 上加入我们了。

来源:MarkTechPost(RSS)· marktechpost.com