📰 研报摘要
查看全文 ➔摘要: 本次分享由英伟达研究员主讲,重点介绍了通过端到端强化学习优化大模型工具编排能力的 ToolOrchestra 工作,以及旨在解决多奖励优化问题的 GDP0 算法。
行业主线:
- 工具编排(ToolOrchestra):通过训练小规模调度器(Orchestrator)调用多样化工具和专业模型,旨在提升复杂推理任务的性能与效率,解决模型在调用工具时存在的“自我增强偏置”或“盲目依赖强模型”问题。
- 多奖励强化学习(GDP0):针对 GRPO 算法在处理多维度奖励(如准确率、效率、用户偏好)时容易出现信号坍缩、分辨率降低的问题,提出 GDP0 算法,通过对每个奖励维度分别进行解耦归一化,保留奖励间的相对差异,提升训练稳定性。
关键变化与分歧:
- 性价比优势:实验表明,采用 8B 小模型作为调度器并调用外部工具的系统,在同等预算下性能优于 GPT-5 等单体模型,且推理速度提升约 2.5 倍,成本降低约 3 倍。
- 用户偏好遵循:ToolOrchestra 在处理包含成本或效果偏好的复杂指令时,表现出比 GPT-5 更强的偏好遵循能力。
受益方向与风险:
- 受益方向:高效能的小规模 Agent 调度系统、多奖励优化算法在数学/代码推理等复杂任务中的应用。
- 风险/局限:强化学习对高质量可验证数据的依赖,以及在极少算力资源下的训练挑战。