基于 LLM 的财务逻辑因子全天候挖掘框架交流纪要

会议纪要 数据与宏观 / 策略观点笔记
🔒
登录解锁完整投研深度报告与行情联动: 免费查阅完整机构研报原件、音频转写、五维画像模型与异动监控
立即登录 / 免费注册

📰 研报摘要

查看全文

摘要: 本次会议由国金证券研究员分享一种利用大模型(LLM)实现财务逻辑因子全天候自动化挖掘的量化框架。该框架旨在结合人工构造的高解释度与机器学习的高效率,通过自动化流程降低因子开发成本并提升因子的实用性。

核心观点:

  1. 构建全天候挖掘闭环:设计了包含因子初始化、因子改进(利用 MMR 限制相关性)及 Idea 提取三个阶段的自动化框架,实现 7x24 小时并行挖掘。
  2. 优化挖掘逻辑:引入 RAG 机制,将成熟因子经验与向量匹配结合,增强 Prompt 的引导能力,使大模型生成的因子具备更连贯的经济学语义。
  3. 量价与基本面双线并行:框架同时支持量价因子(侧重波动与动量)和基本面因子(侧重财务报表滚动指标),并针对基本面因子的复杂算子设计了语法树修正机制。

论据支撑:

  1. 回测效果:量价因子合成后,多头年化超额收益率可达 17.4%,超额净值曲线稳健。基本面因子虽波动较大,但在风险暴露控制上表现更优。
  2. 对比优势:相比于传统的遗传规划(GP)等暴力组合方法,LLM 挖掘能保持因子的可解释性,且能根据具体 Idea 进行定向改进。
  3. 实操流程:采用“内层循环(并行挖掘)+ 外层循环(收益与相关性控制)”结构,每轮可筛选出 2-3 个优质因子入库。

局限性/风险:

  1. 计算能力限制:大模型不擅长直接进行数值计算,因此框架仅将其用于生成公式,具体的计算与回测仍需在本地环境下完成。
  2. 样本外表现风险:为避免未来信息泄露,需严格区分挖掘样本期(如 2010-2019 年)与检验样本期(如 2020-2025 年)。