智能驾驶 VLA 模型的架构范式与厂商路线研究

机构研报 行业研究 / 行业深度专题 申万: 汽车零部件 理想汽车-W (02015.HK)
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

本报告分析了自动驾驶架构从语义推理向原生动作生成(VOA)的演进趋势。VOA 架构通过增加显式动作头补齐了视觉语言模型(VLM)在动作生成上的缺口,实现了感知、推理与控制的深度耦合。报告对比了不同厂商的技术路径:理想 MindVLA 采用 3D Gaussian 表征与 MoE 架构,选用扩散头(Diffusion Head)以确保轨迹平滑度;小鹏第二代 VLA 剔除显式语言中间层,通过“视觉思维链”降低预测误差并提升实时性,计划 2026Q1 在 Ultra 车型推送;元戎启行 40B 模型则通过集成 Driver、Analyst、Critic 三角色实现内生数据闭环。目前 VOA 规模化落地的核心瓶颈在于 30Hz 推理帧率对算力的极高要求以及三模态配对数据的稀缺,需通过量化、蒸馏及芯片级优化(如小鹏图灵芯片)来突破。