从 LLM 到 VLM 再到 VLA 的具身智能架构演进与自动驾驶应用趋势

会议纪要 行业研究 / 行业交流纪要 申万: 计算机
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

本文探讨了从大语言模型(LLM)到视觉语言模型(VLM)再到视觉-语言-动作模型(VLA)的技术演进路径。VLM 通过视觉编码器和模态对齐模块实现多模态统一建模;VLA 则进一步将能力迁移至具身智能,通过离散动作 token 化、连续动作生成或双系统(快慢系统)架构实现物理世界的动作输出。文中详细对比了离散动作路线与连续动作生成路线的优劣,并分析了双系统架构与 JEPA 架构在底层逻辑上的区别。在应用方面,自动驾驶头部企业已基本切换至 VLA 架构,目前的趋势是探索移除模型中的语言(L)部分,以强化视觉到动作的直接映射。