📰 研报摘要
查看全文 ➔本报告分析了自动驾驶架构从语义推理向原生动作生成(VOA)的演进趋势。VOA 架构通过增加显式动作头补齐了视觉语言模型(VLM)在动作生成上的缺口,实现了感知、推理与控制的深度耦合。报告对比了不同厂商的技术路径:理想 MindVLA 采用 3D Gaussian 表征与 MoE 架构,选用扩散头(Diffusion Head)以确保轨迹平滑度;小鹏第二代 VLA 剔除显式语言中间层,通过“视觉思维链”降低预测误差并提升实时性,计划 2026Q1 在 Ultra 车型推送;元戎启行 40B 模型则通过集成 Driver、Analyst、Critic 三角色实现内生数据闭环。目前 VOA 规模化落地的核心瓶颈在于 30Hz 推理帧率对算力的极高要求以及三模态配对数据的稀缺,需通过量化、蒸馏及芯片级优化(如小鹏图灵芯片)来突破。