📰 研报摘要
查看全文 ➔本次报告分析了 Kimi 更新的 K3 模型,该模型参数规模达 2.8 万亿,支持 100 万 Token 上下文及原生视觉能力,实现了从单轮问答向复杂生产任务(如长时程编程、知识工作与复杂推理)的能力跨越。技术层面,K3 采用 Kimi Delta Attention、Attention Residuals 及 Stable LatentMoE 架构,显著提升了缩放效率,并建议在 64 张以上加速卡的超节点部署,强调了高带宽互联和推理集群的重要性。商业化方面,K3 的 API 定价中枢随智能能力提升而上移,而通过 Mooncake 分离式推理架构优化缓存效率成为在提价同时维持竞争力的关键。报告认为,国产模型在复杂 Workflow 执行能力上与海外前沿模型差距正在收窄,有望推动 API 价格中枢、调用量及商业化空间同步改善。