DrivingBench 基准测试多模型遥控驾驶表现
先了解这件事
2026 年 9 月 23 日至 24 日,Hacker News 上出现关于 DrivingBench 基准测试的讨论。该基准由 drivingbench.com 页面展示,让多个大模型通过 set_motion 等指令操控车辆沿赛道中心线行驶,并按多项指标对比表现,包括保持在 4 米内的进度占比、GPS 集成距离、完成时间、指令数以及 token 数与成本;9 月 24 日的报道进一步称,实测中多数模型尝试未能完赛。9 月 29 日,404 Media 报道补充了测试细节:三位湾区科技从业者组成 DrivingBench,用 Comma 套件把 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 接入丰田卡罗拉的转向、油门和刹车,在公共停车场锥形路线上测试未专门训练的前沿模型能否开车,并称仅一个模型完赛。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- 404 MediaDrivingBench 让 ChatGPT 等大语言模型开丰田卡罗拉跑绕桩,仅一个模型完赛
三位湾区科技从业者组成 DrivingBench,用 Comma 套件把 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 接入丰田卡罗拉的转向、油门和刹车,在公共停车场锥形路线上测试未专门训练的前沿模型能否开车。
- Hacker News 热门(buzzing.cc 中文翻译)DrivingBench 实测多款大模型遥控驾驶,多数尝试未完赛
drivingbench.com 展示一个让大模型通过 set_motion 等指令驾驶车辆沿赛道中心线行驶的基准,按完成进度、行驶距离、完赛时间、指令数和 token 成本计分。
- Hacker News:AI 热帖DrivingBench 基准测试对比多个模型操控车辆沿赛道行驶的表现
drivingbench.com 页面对多个模型操控车辆沿赛道中心线行驶进行了对比,指标包括保持在 4 米内的进度占比、GPS 集成距离、完成时间、指令数以及 token 数与成本。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。