LLM-MCTS 驱动的可解释量化因子迭代框架研究

机构研报 数据与宏观 / 策略观点笔记
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

摘要: 本报告提出了一种基于 LLM-MCTS(大语言模型-蒙特卡洛树搜索)的可解释因子迭代框架,旨在实现量化因子研究从“人工写因子”向“AI 挖因子”的范式升级。该框架将 LLM 的语义生成与逻辑推理能力作为“扩展器”,结合 MCTS 的路径控制与反馈闭环,解决了传统量化研究中效率低、黑箱化或易过拟合的痛点。

核心观点:

  1. 构建闭环迭代体系:通过“选择-扩展-评测-回传”的 MCTS 机制,将金融假说生成、表达式构建与量化回测组织成闭环,兼顾了因子的可解释性与搜索效率。
  2. 实证结果显著:在日频价量因子改造实验中,大部分最终入选因子在样本内全部优于原因子,且约 65.5% 在样本外同样表现更优。
  3. 覆盖多频域场景:框架不仅适用于低频价量因子的定向改造与批量挖掘,在分钟级高频因子挖掘(如高量脉冲次数机制)中亦展现出强预测能力。

论据支撑:

  1. 机制设计:引入 UCT 机制在利用高分路径与探索未知分支间取得平衡,并利用 LLM 进行逻辑审查以过滤低质量候选,确保因子具备金融逻辑。
  2. 案例验证:如 std20 因子通过将收盘价标准差替换为“成交量加权真实波幅”,显著提升了样本外 RankIC 和多空净值。
  3. 多样性分析:批量挖掘出的 123 个唯一公式之间绝对相关性均值仅为 0.2604,证明搜索结果具有较低的同质化程度。

局限性/风险:

  1. 模型与数据风险:量价因子存在失效风险且依赖行情数据质量,历史表现不代表未来收益。
  2. 技术风险:自动化挖掘可能导致过拟合,且 LLM 生成的代码或逻辑可能存在理解偏差。