LLM-MCTS 驱动的可解释因子迭代框架研究

机构研报 数据与宏观 / 策略观点笔记
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

摘要: 本报告提出了一种基于大语言模型(LLM)与蒙特卡洛树搜索(MCTS)相结合的量化因子迭代框架,旨在实现从“人工写因子”向“AI 挖因子”的范式升级,在保证金融可解释性的同时提升因子挖掘的效率与质量。

核心观点:
构建 LLM-MCTS 闭环框架,由 MCTS 负责搜索路径控制(选择、扩展、评测、回传),LLM 负责生成金融假说及可执行表达式,并通过真实数据回测结果引导迭代。该框架能有效覆盖日频 Seed 改造、低频池批量挖掘及高频行为挖掘,显著提升因子的样本外预测能力。

论据支撑:

  1. 框架机制:利用 UCT 机制平衡“利用”与“探索”,通过 reward 函数(涵盖预测强度、稳定性、覆盖率、换手、多样性及过拟合惩罚)引导搜索,避免结果坍缩至同质信号。
  2. 实证效果:在 29 个低频价量 Seed 的迭代中,样本内入选因子全部优于原因子,其中 19 个在样本外同样优于原因子。批量挖掘中,123 个唯一公式显示出较低的全局相关性(中位数 0.2148)。
  3. 高频挖掘:识别出“高量脉冲次数”等强机制,样本外 RankIC 达 0.0744,证明了状态切换次数在微观结构中的预测价值。
  4. 案例分析:通过将收盘价波动率升级为成交量加权真实波幅(std20)、将下跌天数重构为成交量加权负乖离(cntn20)等方式,提升了信号的信噪比。

局限性/风险:
主要包括模型失效风险(历史规律不代表未来)、自动化挖掘带来的过拟合风险、数据质量影响以及 LLM 生成代码的逻辑偏差和实盘交易成本风险。