一个原本用来写代码、处理文档和执行电脑任务的大模型,现在开始开真车了。
近日,独立研究项目 DrivingBench 公布了一项颇具实验性质的测试:研究人员让 GPT-6 Astra、Claude Fable 5.1、Grok 4.6以及 GPT-5.6 Sol,分别控制一辆真实的2022款丰田卡罗拉,在停车场内完成由锥桶划定的固定路线。
最终,GPT-6 Astra成为四个模型中唯一完成全部赛道的模型。
第二次尝试中,Astra驾驶车辆完成134.7米路线,用时5分22秒。Claude Fable 5.1最好成绩为45%,Grok 4.6为11%,GPT-5.6 Sol则只有6%。
国内一些报道因此将这场测试形容为大模型第一次考过科目二。不过,这显然不是一场真正意义上的驾照考试。DrivingBench没有按照任何国家的驾驶证考试标准进行测试,场地也并非公共道路,而是一处空旷停车场。
真正值得关注的是,一个并非专门为自动驾驶研发的通用大模型,已经可以通过视觉信息观察真实世界,并形成感知、判断、规划和车辆控制的闭环。
一台卡罗拉一套大模型控制系统
DrivingBench由Aditya Ramabadran、Simon Mahns和Tobias Gessler三名研究者创建,他们提出的问题很简单:今天最先进的通用大模型,到底能不能直接开一辆真实汽车?
测试车辆是一辆2022款丰田卡罗拉。
研究人员在车辆上安装了comma four设备,并通过OBD-C接口接入车辆CAN总线,底层车辆控制则建立在开源辅助驾驶系统openpilot之上。
车辆摄像头拍摄到的画面以及速度、方向盘状态等信息,会实时传输至电脑,再通过MCP工具交给大模型。模型能够使用三个核心工具:观察车辆周围环境、设定行驶方向及速度,以及立即停车。最终的转向、加速和制动指令再经过openpilot传递给车辆。
换句话说,GPT-6 Astra并没有直接生成传统自动驾驶系统中的方向盘扭矩或者制动压力。它更像坐在驾驶位上的大脑。
Astra根据摄像头画面判断车辆在哪里、道路往哪边延伸、什么时候需要转弯,然后告诉底层控制系统向左还是向右、转多少、以什么速度行驶以及持续多长时间。
测试路线设计成一个类似倒U形的停车场赛道,其中包含左转、直线、缓弯、右转等场景,终点则是一块由蓝色锥桶围出的停车区域。
这套设计和目前量产汽车中的自动驾驶架构差异很大,却很像近年来机器人行业越来越常见的一种思路:让通用模型负责理解环境和任务,再通过标准化工具调用底层执行机构。
第一把失败第二把学会了慢下来
GPT-6 Astra的第一次驾驶并不顺利。
第一轮测试中,它行驶67.3米,完成大约49%的路线,用时1分18秒。车辆经过第一个弯道后逐渐偏向左侧锥桶和绿化区域,安全员最终进行了人工干预。