📰 研报摘要
查看全文 ➔摘要: 本次电话会聚焦于腾讯最新发布的混元Hy3正式版模型,通过五个具体评测场景(财报分析、3D跑酷游戏编程、长文检索与幻觉测试、元旦菜谱工具调用、小程序从0到1构建)将其与 DeepSeek V4 Pro 和 GLM 5.1 进行横向对比,旨在评估模型的迭代方向、实际可用性及性价比。
核心观点/结论:
混元Hy3正式版在综合能力上表现强劲,尤其在事实验证、长文检索、逻辑编程和复杂任务规划方面具有显著优势。在多数测评场景中综合排名第一或第二,且模型迭代斜率较高,被认为进入了快速迭代元年。
经营与财务要点:
- 技术架构:采用 MoE 架构,总参数约 295B(激活参数约 21B),支持最大 256K 上下文长度。
- 能力升级:核心迭代聚焦于 Coding Agent 和 Working Agent,显著提升了前端开发、复杂工作流规划、长文本处理及多工具调用能力。
- 性价比:相比于 GLM 等模型,混元Hy3在 Token 消耗和积分成本上具有潜在竞争力,预计定价将较为实惠。
催化剂与风险:
- 催化剂:预期在 4 季度初推出更大参数版本的大模型。
- 风险/不足:多模态图片生成工具的调用精准度仍有提升空间,部分生成图像与实际需求存在偏差。