📰 研报摘要
查看全文 ➔本报告探讨自动驾驶技术从模仿学习向强化学习(RL)的范式跃迁。报告认为,模仿学习受限于示范数据质量及协变量漂移,难以实现超越人类的安全目标,而强化学习通过奖惩机制能有效突破模仿边界,由事后增强转变为突破上限的关键环节。同时,世界模型为强化学习提供了高保真、可重置的闭环试错环境,两者形成双向共生关系。目前产业实践正向“端到端+世界模型仿真+强化学习后训练”收敛,但在是否以语言为中介(VLA)、RL 披露程度及量产辅助驾驶与 L4 Robotaxi 的定位上仍存在分化。报告详细对比了特斯拉、小鹏、理想、华为、Momenta、地平线、小马智行等厂商的技术路线,强调物理 AI 需通过强化学习与世界模型的结合来解决物理世界的建模闭环问题。