📰 研报摘要
查看全文 ➔摘要: 本报告详细介绍了 DeepSeek-V4 系列(包括 Pro 和 Flash 版本)的架构创新与性能评估,重点探讨了如何通过架构优化突破超长文本处理的计算效率瓶颈,实现原生支持百万级 Token 上下文。
行业主线:
- 计算效率架构升级:引入混合注意力机制(结合压缩稀疏注意力 CSA 和重度压缩注意力 HCA)以及流形约束超连接(mHC),大幅降低了长文本场景下的推理 FLOPs 和 KV 缓存占用。
- 训练与优化增强:采用 Muon 优化器提升收敛速度,并利用预期路由(Anticipatory Routing)和 SwiGLU 截断技术解决万亿参数 MoE 模型的训练不稳定性。
- 后训练范式转移:采用多教师在策略蒸馏(OPD)替代传统 RL 阶段,通过 logit 级对齐高效整合领域专家能力。
关键变化与分歧:
- 长文本处理能力的飞跃:在 100 万 Token 上下文设置下,DeepSeek-V4-Pro 的推理成本显著低于 DeepSeek-V3.2,且在 MRCR 等检索任务中表现强劲。
- 开源模型性能标杆:DeepSeek-V4-Pro-Max 在世界知识、复杂推理、代码生成等任务上重新定义了开源模型标准,部分指标已接近顶级闭源模型(如 Gemini-3.1-Pro)。
受益方向与风险:
- 受益方向:超长文档分析、复杂 Agentic AI 工作流、高性能低成本的 LLM 推理部署。
- 核心风险:超大规模 MoE 模型的训练稳定性挑战、长文本检索的精度衰减以及对高端硬件算力的持续依赖。