从 LLM 到 VLM 再到 VLA 的具身智能架构演进与自动驾驶应用趋势

会议纪要 行业研究 / 行业交流纪要 申万: 计算机
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

本文探讨了从大语言模型(LLM)到视觉语言模型(VLM)再到视觉语言动作模型(VLA)的技术演进路径及其在具身智能和自动驾驶中的应用。VLM 通过视觉编码器和模态对齐将视觉特征转化为 token,实现多模态统一建模;VLA 则将 VLM 能力迁移至物理世界,实现动作输出,主要技术路线包括离散动作 token 化、连续动作生成以及双系统(快慢系统)架构。其中,离散化路线复用 LLM 序列建模但精度较低,连续生成更适合高频精细控制,而双系统架构实现了任务意图与实时控制的分离。在自动驾驶领域,头部企业已基本切换至 VLA 架构,且存在移除语言(L)部分以强化视觉到动作直接映射的趋势。