新兴 AI 云与开源模型 Token 优化分析——以 Nebius 为例

会议纪要 行业研究 / 行业交流纪要 申万: 计算机
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

本文通过分析新兴 AI 云厂商 Nebius 的案例,探讨 AI 云服务的商业拐点与技术优化路径。研究认为,新兴云厂商通过深度绑定 NVIDIA 生态并采用裸金属租赁模式,可显著降低虚拟化损耗,使单位算力成本降低约 50%,推理总拥有成本比亚马逊(AWS)低 112%。Nebius 通过 TokenFactory 服务将业务从算力租赁延伸至优化后的开源模型服务,在硬件端通过定制 ODM 机箱和液冷布局降低成本与能耗,在软件端利用 AWQ 量化与稀疏注意力机制提升 Token 吞吐量 2-4 倍,从而将推理毛利率从 30% 提升至 80%。商业模式上,TokenFactory 在降低客户成本的同时,通过减少单次任务所需 GPU 数量提升了单卡收入。目前 Nebius 客户结构较为健康,微软与 Meta 贡献约 50% 收入,且企业端出于成本、灵活编排及数据合规需求,正加速向开源模型迁移。