AI 因子挖掘的双路径实践与 Skill 沉淀——从表达式搜索到 Agent 化研究流程

机构研报 数据与宏观 / 策略观点笔记
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

摘要: 本报告研究了利用大语言模型(LLM)提升量化因子挖掘效率的方法论,提出了基于“表达式空间”和“代码空间”的两条实践路径,并将其封装为可迭代的 AI 量化研究工作流(Skill)。

核心观点:
AI 因子挖掘应从单纯的“结果生成”转向“能力沉淀”。通过将 LLM 的金融逻辑推理能力与自动化搜索/代码生成相结合,可以挖掘出具有较高截面预测能力且与传统量价因子低相关的增量因子,构建一个可复盘、可继承的研究系统。

论据支撑:

  1. LLM 增强遗传编程(表达式路线):利用 LLM 提取金融基因约束搜索空间,生成 87 个候选因子,全区间 |RankIC| 均值 6.98%,相对 Alpha158MLP 具有 2.53% 的平均增量 IC。
  2. 闭环式因子代码挖掘(函数路线):允许 AI 直接编写 Python 函数并沉淀工具库,生成 80 个因子,RankIC 均值 4.90%,能够更精准地刻画隔夜-日内修正、极值形成过程等复杂交易行为。
  3. 流程产品化:开发【东吴金工】选股因子迭代 Skill,构建了从数据接入、因子生成到自动评测与工具沉淀的 Agent 化闭环。

局限性/风险:
主要风险包括量价因子的历史失效风险、自动化搜索带来的过拟合风险、极端行情下的信号失效,以及大模型生成代码可能存在的逻辑偏差或计算冗余。