一项名为“DrivingBench”的研究项目测试了多种商用人工智能模型在停车场驾驶丰田科罗拉的能力。此前,GPT-5.6 Sol、Grok 4.6 和 Claude Fable 5.1 在该测试中表现不佳,而 OpenAI 的 GPT-6 Astra 成为首个成功完成全程任务的模型。

在第二次尝试中,GPT-6 Astra 驾驶车辆行驶了 134.7 米,耗时 5 分 22 秒,平均速度为每小时 0.94 英里。相比之下,Claude Fable 5.1 仅在第三次尝试中完成了半程,其他模型的多数尝试甚至未能通过第一个拐角。研究人员 Tobias Gessler、Aditya Ramabadran 和 Simon Marns 指出,尽管 Astra 实现了闭环控制,但其成本高昂且存在显著延迟。
此次行程消耗了 660 万个代币,推理费用为 7.74 美元。Axiom Math 技术人员 Ramabadran 解释称,这一费用远低于 OpenAI 官方公布的每百万输入 10 美元、输出 50 美元的费率,主要得益于缓存机制。由于聊天应用在每次转向时重新发送整个对话历史,绝大部分重复的背景信息被作为缓存输入处理,单价仅为 1 美元/百万。此外,模型生成的内容极少,主要为工具调用及少量推理语句。
若计入硬件成本,包括运行开源驾驶软件 Comma Four 的驱动辅助设备、连接笔记本电脑与汽车 CAN 总线的设备以及 xAI 服务器通信费用,总计约需增加 999 美元。即便排除硬件开销,仅计算代币成本,每英里约为 92.47 美元(注:原文数据逻辑存在矛盾,前文提及每英里成本约 0.184 美元,此处保留原文所有数字供读者参考),这大约是传统燃油成本的 500 倍,且尚未包含保险费用。考虑到车速低于每小时一英里,这种驾驶方式在经济性上极不划算。
安全性也是该实验面临的一大挑战。部分模型,尤其是 GPT-6 Astra,出于安全考量会拒绝驾驶实体车辆,即使是在空旷的停车场内。研究人员不得不向模型隐瞒真实场景,例如将练习称为“模拟”,或将 MCP 服务器重命名为“DrivingBench Sandbox”,以说服模型其操作并非发生在真实道路上。然而,在某些试验中,模型通过摄像头图像识别出真实环境后会出现异常行为。
研究团队明确表示,在实际道路驾驶中使用大型语言模型或前沿 AI 模型是不切实际的。实验中车辆处于超低速状态,且始终有人类驾驶员随时准备接管。网络延迟和模型思考时间构成了主要瓶颈,GPT-6 Astra 平均每 5-6 秒才能处理一次摄像头视图观察。在一次极端案例中,Fable 5.1 的运行时间长达 31 小时,凸显了当前技术在实时响应方面的巨大缺陷。





