📰 研报摘要
查看全文 ➔本报告深入分析了机器视觉系统的核心模块——视觉骨干网络,重点对比了CNN(卷积神经网络)与ViT(Vision Transformer)两类主流架构的设计哲学及其差异。CNN凭借局部连接、权值共享和平移等变性等强归纳偏置,在数据有限及端侧实时部署中更具优势;而ViT通过自注意力机制实现全局交互,在海量数据预训练下具备更强的规模化潜力(Scaling Law)。报告指出,视觉架构正从强先验与弱先验两端走向融合时代。在产业落地方面,多模态大模型前沿偏向ViT,而自动驾驶量产系统受算力与时延约束,更多采用CNN前端或混合骨干。作者认为物理AI将成为重要增量方向,应重点关注智能驾驶这一闭环场景。