📰 研报摘要
查看全文 ➔本文探讨了从大语言模型(LLM)到视觉语言模型(VLM)再到视觉语言动作模型(VLA)的技术演进路径及其在具身智能和自动驾驶中的应用。VLM 通过视觉编码器和模态对齐将视觉特征转化为 token,实现多模态统一建模;VLA 则将 VLM 能力迁移至物理世界,实现动作输出,主要技术路线包括离散动作 token 化、连续动作生成以及双系统(快慢系统)架构。其中,离散化路线复用 LLM 序列建模但精度较低,连续生成更适合高频精细控制,而双系统架构实现了任务意图与实时控制的分离。在自动驾驶领域,头部企业已基本切换至 VLA 架构,且存在移除语言(L)部分以强化视觉到动作直接映射的趋势。