跳到正文
热点事件持续更新

DrivingBench 基准测试多模型遥控驾驶表现

3 篇报道3 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 9 月 23 日至 24 日,Hacker News 上出现关于 DrivingBench 基准测试的讨论。该基准由 drivingbench.com 页面展示,让多个大模型通过 set_motion 等指令操控车辆沿赛道中心线行驶,并按多项指标对比表现,包括保持在 4 米内的进度占比、GPS 集成距离、完成时间、指令数以及 token 数与成本;9 月 24 日的报道进一步称,实测中多数模型尝试未能完赛。9 月 29 日,404 Media 报道补充了测试细节:三位湾区科技从业者组成 DrivingBench,用 Comma 套件把 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 接入丰田卡罗拉的转向、油门和刹车,在公共停车场锥形路线上测试未专门训练的前沿模型能否开车,并称仅一个模型完赛。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. 404 Media
    DrivingBench 让 ChatGPT 等大语言模型开丰田卡罗拉跑绕桩,仅一个模型完赛

    三位湾区科技从业者组成 DrivingBench,用 Comma 套件把 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 接入丰田卡罗拉的转向、油门和刹车,在公共停车场锥形路线上测试未专门训练的前沿模型能否开车。

9月24日
  1. Hacker News 热门(buzzing.cc 中文翻译)
    DrivingBench 实测多款大模型遥控驾驶,多数尝试未完赛

    drivingbench.com 展示一个让大模型通过 set_motion 等指令驾驶车辆沿赛道中心线行驶的基准,按完成进度、行驶距离、完赛时间、指令数和 token 成本计分。

9月23日
  1. Hacker News:AI 热帖
    DrivingBench 基准测试对比多个模型操控车辆沿赛道行驶的表现

    drivingbench.com 页面对多个模型操控车辆沿赛道中心线行驶进行了对比,指标包括保持在 4 米内的进度占比、GPS 集成距离、完成时间、指令数以及 token 数与成本。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。