AI 因子挖掘的双路径实践与 Skill 沉淀研究

机构研报 数据与宏观 / 策略观点笔记
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

摘要: 本报告探讨了利用大语言模型(LLM)提升量化因子挖掘效率的两条实践路径,旨在将 AI 从简单的代码生成工具升级为可迭代、可沉淀的自动化研究流程,并构建了标准化的因子迭代工作流。

核心观点:

  1. 双路径挖掘实践:提出了“LLM 增强遗传编程(表达式空间)”与“闭环式代码挖掘(函数空间)”两条路线,分别利用 LLM 的金融逻辑推理能力与算法的高通量搜索能力,解决因子挖掘中可控性与表达能力的矛盾。
  2. 从结果生成转向能力沉淀:主张将 AI 因子研究由单次因子产生提升为“研究流程”的沉淀,通过构建工具函数库将复杂交易行为的刻画能力转化为可复用的研究资产。

论据支撑:

  1. 实证有效性:LLM 增强遗传编程生成的 87 个因子全区间 |RankIC| 均值约 6.98%;函数式挖掘生成的 80 个因子 RankIC 均值约 4.90%。两类因子在剔除 Alpha158MLP 基准影响后均具有显著的增量 IC。
  2. 复杂行为刻画:通过对质量动量(LOWPOS_SHARPE_COV)、情绪反转(CANDLE_SHADOW_P3)及量价拥挤(RETCHG_MINUS_GAP)等代表因子的分析,证明了 AI 能捕捉细颗粒度的交易机制。
  3. 流程产品化:开发了【东吴金工】选股因子迭代 Skill,实现了“数据接入 $\rightarrow$ 因子生成 $\rightarrow$ 自动评测 $\rightarrow$ 历史反馈 $\rightarrow$ 工具沉淀”的 Agent 化研究闭环。

局限性/风险:

  1. 模型与过拟合风险:历史统计规律不代表未来收益,自动化搜索在大空间内可能挖掘到偶然有效的模式。
  2. 环境与数据风险:极端行情下常规量价关系可能失效;底层数据质量或评测口径偏差会影响结论。
  3. LLM 生成风险:AI 生成的代码可能存在实现错误、冗余计算或隐含逻辑偏差。