📰 研报摘要
查看全文 ➔本报告深入探讨了视觉智能领域引入Transformer架构的演进逻辑。报告指出,CNN在视觉领域依靠局部连接、权重共享和平移等变性确立了统治地位,但其局部感受野、任务专用和封闭标签等结构性局限,构成了Transformer进入视觉任务的前提。Transformer通过“patch即token”范式实现了全局建模与多模态对齐,但其与视觉归纳偏置的契合度不及语言领域,因此演进路径表现为与卷积神经网络的融合与再平衡,而非彻底替换。报告将视觉Transformer的演进归纳为三大阶段:图像token化、通用骨干重构与视觉基础模型(自监督预训练、开放词表、可提示分割)的形成。目前,视觉智能已完成架构与规模跃迁,但尚未实现独立于语言中枢的推理能力。报告强调,视觉基础模型在物理世界感知中的确定性价值突出,智能驾驶作为物理AI跑通闭环的代表场景,具备显著的产业落地潜力。