智能驾驶 VLA 模型的架构范式与厂商路线分析

机构研报 行业研究 / 行业深度专题 申万: 汽车零部件 理想汽车-W (02015.HK)
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

本次报告深入分析了智能驾驶 VLA(视觉-语言-动作)模型的架构范式与厂商技术路线。报告指出自动驾驶正从模块化、端到端及 VLM4AD 演进至 VLA4AD 范式,旨在通过显式动作头弥合语义理解与控制生成之间的缺口。VLA 核心架构通常涵盖视觉编码器、语言处理器和动作解码器,目前正处于从被动解释器向推理中枢演进的过程中。在厂商路线方面,Waymo EMMA 采用基于 Gemini 的纯端到端架构;理想汽车通过 MindVLA 实现了三维空间理解、语义推理与动作生成的统一;小鹏汽车第二代 VLA 则倾向于弱化显式语言中间层,通过原生多模态 Tokenizer 和超密视觉思维链(Visual CoT)提升推理效率并降低预测误差。报告认为,VLA 规模化落地仍面临鲁棒性、实时算力约束、数据标注及多模态对齐等挑战。后续竞争将集中在实时性、数据闭环、评测口径和量产可靠性。