📰 研报摘要
查看全文 ➔摘要: 本文探讨了将大语言模型(LLM)与强化学习(RL)结合应用于量化因子挖掘的创新框架。通过对因子表达式进行 Token 化建模,利用 MaskablePPO 算法在 AlphaPool 环境中实现序列决策,自主搜索高质量 Alpha 因子;同时引入 LLM 的金融领域知识,通过构建初始种子池和定期注入新因子来克服纯 RL 模型缺乏语义理解、易产生不合逻辑因子的短板。
核心观点:
- 技术融合优势:RL 擅长在海量参数空间中高效搜索,而 LLM 能提供具备经济学含义的逻辑引导,两者结合显著提升了因子挖掘的效果与稳定性。
- 量化增益明显:实验验证 LLM 的增强作用,在沪深 300 和中证 500 指增策略中,融入 LLM 后年化超额收益分别提升至 17.85% 和 9.78%。
- 泛化性与独立性:不同指数池训练的因子具有较好的跨池泛化能力,且与 Barra 风险因子及 GRU 量价因子的相关性较低。
论据支撑:
- 回测表现:LLM+RL 框架在沪深 300 指增策略中信息比率达 1.50,在中证 500 中达 0.67。
- 模型对比:Transformer 架构比 LSTM 更稳定,且在 2025 年回撤期间表现更优;因子长度在 [3, 8] 范围时年化超额最高,但 [0, 15] 范围稳定性最佳。
- 参数测试:通过对奖励设置、训练步数(1万步 vs 20万步)及因子数量进行对比,验证了当前框架的鲁棒性。
局限性/风险:
- 过拟合风险:长时程训练(15万步以上)会导致测试集超额收益明显下降,显示出过拟合倾向。
- 模型风险:LLM 输出存在不稳定性,且强化学习模型的可解释程度较低,实际应用需谨慎。