📰 研报摘要
查看全文 ➔摘要: 本报告提出了一种基于“深度学习预测+强化学习优化”的量化指数增强策略框架,旨在将传统的静态因子选股升级为动态权重决策,以提升在沪深300和科创50等宽基指数上的超额收益并控制回撤。
核心观点:
- 构建端到端决策框架:通过“深度学习预测 $\rightarrow$ 强化学习优化”两层体系,实现从基础 K 线数据到个股权重的直接映射。深度学习模块负责收益风险信号预测,PPO(近端策略优化)模型则负责将信号转化为动态配置权重。
- 引入自融资投影机制:利用 Banach 不动点迭代求解调仓后的组合规模,解决了交易成本导致的目标权重与组合价值不自洽问题。
- 验证策略有效性:回测结果显示,该框架在科创 50 指数上相比传统凸优化方法有显著改善,能更有效地重配未来表现优异的个股。
论据支撑:
- 算法实现:PPO 模型采用 Actor-Critic 架构,通过裁剪目标函数提升训练稳定性,并设计包含超额收益、风险暴露、跟踪误差和换手率在内的综合奖励函数。
- 回测表现:2020-2026 年回测区间内,沪深 300 策略实现年化超额收益 4.26%,科创 50 策略实现年化超额收益 12.52%,且两者均降低了最大回撤。
- 消融实验:通过对比验证,证明了实际超额收益项、Alpha 信号及换手约束在奖励函数中对提升组合长期表现具有不可替代的作用。
局限性/风险:
- 泛化能力波动:策略在不同市场环境下的表现存在差异,部分年份(如 2025 年)受风格切换影响,表现弱于基准指数。
- 统计局限性:结论基于历史价格数据和统计规律,无法完全预测受即时政策影响的非线性市场走势。