📰 研报摘要
查看全文 ➔本报告探讨自动驾驶技术从模仿学习向强化学习(RL)的范式跃迁。报告认为,模仿学习因依赖人类驾驶演示数据且存在协变量漂移问题,其能力上限难以满足 L4 级自动驾驶对安全性的苛刻要求,因此强化学习成为突破能力边界的关键环节。在物理 AI 环境中,强化学习与世界模型形成双向共生:世界模型为 RL 提供可反复试错的高保真闭环仿真环境,而真实路采数据则用于持续校准世界模型的保真度。目前产业实践正向“端到端+世界模型仿真+强化学习后训练”的技术组合收敛,但在是否引入语言中介(VLA)以及量产辅助驾驶与 L4 Robotaxi 的定位上仍存在分化。报告分析了特斯拉、小鹏、理想、华为、Momenta、地平线等主流厂商的路线差异,结论认为强化学习已从可选的增强工具转变为实现高物理闭环任务的核心环节。