汽车行业深度报告:AI系列深度17期,视觉智能为何引入Transformer?

机构研报 行业研究 / 行业深度专题 申万: 汽车零部件
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

本报告深入探讨了视觉智能领域引入Transformer架构的演进逻辑。报告指出,CNN在视觉领域依靠局部连接、权重共享和平移等变性确立了统治地位,但其局部感受野、任务专用和封闭标签等结构性局限,构成了Transformer进入视觉任务的前提。Transformer通过“patch即token”范式实现了全局建模与多模态对齐,但其与视觉归纳偏置的契合度不及语言领域,因此演进路径表现为与卷积神经网络的融合与再平衡,而非彻底替换。报告将视觉Transformer的演进归纳为三大阶段:图像token化、通用骨干重构与视觉基础模型(自监督预训练、开放词表、可提示分割)的形成。目前,视觉智能已完成架构与规模跃迁,但尚未实现独立于语言中枢的推理能力。报告强调,视觉基础模型在物理世界感知中的确定性价值突出,智能驾驶作为物理AI跑通闭环的代表场景,具备显著的产业落地潜力。