📰 研报摘要
查看全文 ➔本报告深入探讨了序列建模的两代核心架构——RNN 与 Transformer 的技术路径与权衡。RNN 通过隐藏状态压缩历史信息,推理成本恒定但训练串行且存在长程遗忘问题;Transformer 则利用自注意力机制实现全局交互,支持高并行训练且长程建模能力强,但计算复杂度随序列长度平方增长,且 KV 缓存带来巨大的显存压力。报告指出,虽然 Transformer 在云端通用基础模型中占据主导,但在端侧、车端等低功耗、低时延场景下,以 Mamba、RWKV 为代表的新循环路线及混合架构因其线性复杂度而重新受到关注。结论认为,Transformer 仍是通用底座主线,而物理 AI(如智能驾驶、机器人)将是效率优化架构(如状态空间模型)的主要增量方向,应重点关注智能驾驶等已跑通闭环的场景。