📰 研报摘要
查看全文 ➔本文探讨了从大语言模型(LLM)到视觉语言模型(VLM)再到视觉-语言-动作模型(VLA)的技术演进路径。VLM 通过视觉编码器和模态对齐模块实现多模态统一建模;VLA 则进一步将能力迁移至具身智能,通过离散动作 token 化、连续动作生成或双系统(快慢系统)架构实现物理世界的动作输出。文中详细对比了离散动作路线与连续动作生成路线的优劣,并分析了双系统架构与 JEPA 架构在底层逻辑上的区别。在应用方面,自动驾驶头部企业已基本切换至 VLA 架构,目前的趋势是探索移除模型中的语言(L)部分,以强化视觉到动作的直接映射。