独立研究项目DrivingBench近日公布了一项实验性测试结果:研究人员让GPT-6 Astra、Claude Fable 5.1、Grok 4.6以及GPT-5.6 Sol四个通用大模型分别控制一辆真实的2022款丰田卡罗拉,在停车场内完成由锥桶划定的固定路线。最终,GPT-6 Astra成为唯一完成全部赛道的模型,第二次尝试中完成134.7米路线,用时5分22秒。其余模型最好成绩分别为45%、11%和6%。
DrivingBench由Aditya Ramabadran、Simon Mahns和Tobias Gessler三名研究者创建,核心问题是:当前最先进的通用大模型能否直接驾驶一辆真实汽车。测试车辆安装了comma four设备,通过OBD-C接口接入车辆CAN总线,底层控制基于开源辅助驾驶系统openpilot。车辆摄像头画面及速度、方向盘状态等信息实时传输至电脑,再通过MCP工具交由大模型处理。模型可使用三个核心工具:观察周围环境、设定行驶方向及速度、立即停车。最终转向、加速和制动指令经openpilot传递给车辆。
GPT-6 Astra并未直接生成传统自动驾驶系统中的方向盘扭矩或制动压力,而是根据摄像头画面判断车辆位置、道路走向及转弯时机,再向底层控制系统发出方向、角度、速度和持续时间指令。测试路线为倒U形停车场赛道,包含左转、直线、缓弯、右转等场景。
第一次测试中,Astra行驶67.3米,完成约49%的路线,用时1分18秒。车辆经过第一个弯道后偏向左侧锥桶和绿化区域,安全员进行了人工干预。研究人员随后让Astra在原有上下文中分析失败原因。Astra在复盘中判断,自己过早认为车辆已完成对正,并将速度提高至1.5米/秒,导致偏离后缺乏足够修正空间。第二次测试中,Astra将速度控制在0.8米/秒以内,并明显增加转向幅度,24次运动指令中有20次使用100%转向请求。该轮测试消耗约660万token,成本约7.74美元,平均行驶速度约0.42米/秒。
测试中还出现了一个值得关注的细节:GPT-6 Astra最初有时会拒绝控制真实车辆,并给出安全方面的理由。即便研究人员告知场地为空旷停车场、速度受限且车内有安全员,模型仍可能拒绝执行。后来研究人员将连接车辆的MCP工具名称改为DrivingBench Sandbox,拒绝现象明显减少。研究团队表示,目前无法确定这一变化是来自模型对测试环境的判断,还是单纯受到Sandbox名称的影响。
需要指出的是,该测试在封闭停车场内进行,无机动车、行人、交通信号灯及复杂道路博弈,系统正常控制速度上限为3.5米/秒,车内始终配有安全员。前视摄像头难以观察近距离障碍物及车辆两侧和后方。每个模型仅进行了一组连续上下文测试,样本量不足以证明系统具备稳定驾驶能力。OpenAI在9月初发布GPT-6 Astra时,主要强调其在计算机操作、浏览器、软件工程和科学研究等领域的能力,并未将汽车驾驶列为核心应用。此次实验的意义在于,通用大模型正在获得对真实物理世界的理解和操作能力,为汽车行业讨论世界模型、Physical AI和具身智能提供了一个具体样本。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。