📰 研报摘要
查看全文 ➔本次报告深入分析了智能驾驶 VLA(视觉-语言-动作)模型的架构范式与厂商技术路线。报告指出自动驾驶正从模块化、端到端及 VLM4AD 演进至 VLA4AD 范式,旨在通过显式动作头弥合语义理解与控制生成之间的缺口。VLA 核心架构通常涵盖视觉编码器、语言处理器和动作解码器,目前正处于从被动解释器向推理中枢演进的过程中。在厂商路线方面,Waymo EMMA 采用基于 Gemini 的纯端到端架构;理想汽车通过 MindVLA 实现了三维空间理解、语义推理与动作生成的统一;小鹏汽车第二代 VLA 则倾向于弱化显式语言中间层,通过原生多模态 Tokenizer 和超密视觉思维链(Visual CoT)提升推理效率并降低预测误差。报告认为,VLA 规模化落地仍面临鲁棒性、实时算力约束、数据标注及多模态对齐等挑战。后续竞争将集中在实时性、数据闭环、评测口径和量产可靠性。