📰 研报摘要
查看全文 ➔摘要: 本报告聚焦于国产大模型训练侧对国产算力适配的里程碑突破,以 DeepSeek V4 为核心案例,深度分析其在脱离英伟达 CUDA 生态及 FP8 绑定方面的技术路径及其对国产算力产业链的战略意义。
行业主线:
- 国产化训练实现从 0 到 1 突破:DeepSeek V4 首次由华为昇腾芯片参与训练,验证了国产算力支撑顶级通用大模型全链路训练的可行性,标志着国产算力应用从推理侧向训练侧的实质性跨越。
- 底层技术去绑定:通过引入 MXFP4 量化感知训练、TileLang 领域专用语言以及 MegaMoE2 融合内核,系统性降低了对 NVIDIA 硬件和软件生态的依赖,降低了国产芯片的迁移成本。
关键变化与分歧:
- 战略意义高于性能表现:尽管在多模态等领域与国际顶尖模型仍有差距,但实现了算力生态的自主可控,解决了 AI 产业发展的底线安全问题。
- 超长上下文效率飞跃:首创 CSA+HCA 混合注意力架构,将百万 token 上下文的推理计算量和显存占用大幅降低,解决了长程 Agent 任务的算力瓶颈。
受益方向与风险:
- 受益方向:国产 AI 芯片与算力基础设施核心厂商、CPU 产业链核心配套标的以及算力硬件上游核心供应链。
- 核心风险:大模型迭代节奏及国产算力软硬件生态适配进度不及预期,行业竞争加剧以及政策监管趋严。