📰 研报摘要
查看全文 ➔本文探讨了视觉智能架构从 CNN 向 Transformer 演进的技术逻辑与收敛过程。CNN 凭借局部链接和权重共享在小样本下高效,但受限于局部感受野且难以处理开放词表任务;Transformer 通过自注意力机制实现全局建模,具备更强的空间交互能力与可扩展性,在大规模数据下性能上限更高。视觉 Transformer 的演进经历了图像 Token 化、通用骨干网络构建以及迈向视觉基础模型三个阶段。尽管计算开销(复杂度 $O(n^2)$)是其核心瓶颈,但 Transformer 已在分类、检测等 SOTA 模型中占据主导。目前视觉领域已验证 Scaling Law 并完成架构与规模跃迁,但在纯视觉输入直接进行复杂推理的“推理跃迁”方面尚未成熟。