大模型开车目前最大的技术瓶颈是什么
大语言模型已经能开动真实汽车,但一场名为DrivingBench的实测揭示出残酷现实——它开得比走路还慢,每公里烧掉近40元token费,距离真正上路还有很长的路。
一、实测结果:能开但远未达标
一项由Aditya Ramabadran等研究员发起的DrivingBench测试,将GPT-6 Astra等通用大模型接入丰田卡罗拉实车,在停车场用锥桶布置了134.7米路线。结果仅有GPT-6 Astra第二次尝试完整跑通,耗时5分22秒,平均时速约1.5公里,每公里消耗的token费用折算近40元人民币。而GPT-5.6、Grok 4.6、Claude Fable 5.1均在前几个弯道就宣告失败。这个测试环节同时考验模型在真实物理反馈下的感知、规划、控制和延迟处理能力。
二、三大瓶颈制约落地
决策延迟高:通用大模型每次决策需走云端推理,几秒钟的延迟放在真实道路上就是移动路障。传统自动驾驶采用车端推理,毫秒级响应,两者差距悬殊。
成本不可承受:DrivingBench仅134米就消耗6.6M tokens、花费7.74美元,换算下来每公里成本近40元人民币。通用模型的高算力消耗与大规模实时驾驶场景天然矛盾。
可靠性不确定:大模型基于概率生成,存在幻觉、输出随机性、知识截断等结构性特点。在零容错的驾驶场景中,模型无法保证同输入同输出,也难以解释完整推理链路,难以满足安全审计要求。
三、行业解法:让大模型做"副驾驶"而非"司机"
目前行业主流是将大模型与专用自动驾驶架构融合,而非让其直接操控车辆。VLA(视觉语言行动)模型将视觉、语言与动作统一,具备常识推理和防御性驾驶能力,能听懂"离大车远一点"这类指令。普渡大学Talk2Drive框架则让大模型理解乘客个性化指令并生成驾驶代码,显著降低人工接管率。理想汽车VLA模型采用端侧快速响应与云端深度解析结合,让简单的驾驶指令直接由车端处理。本质上,让大模型充当"会思考的副驾驶",弥补传统系统缺乏常识解释的短板,比让它直接开车更现实。