📰 研报摘要
查看全文 ➔摘要: 本报告解读前沿论文 DiffsFormer,介绍一种基于条件扩散模型的股票特征增强方法,旨在解决量化选股中信噪比低和数据同质化导致的数据稀缺问题,从而缓解模型过拟合,提升样本外泛化能力。
核心观点:
DiffsFormer 将扩散模型定位为即插即用的上游数据增强模块,通过“源域训练、目标域编辑、条件引导”的闭环机制,在不改变下游预测模型结构的前提下,生成高保真的合成特征样本,能够显著提升量化模型在 A 股市场的样本外年化收益率。
论据支撑:
- 机制创新:采用“编辑现有样本”替代“纯噪声生成”以保证保真度;利用全 A 股源域进行迁移学习以缓解行业同质化;引入收益率标签与行业信息作为条件约束,确保生成特征与标签匹配。
- 实证结果:在 A 股 CSI300 和 CSI800 指数样本上验证,八类常用机器学习模型的年化收益率获得一致提升,相对提升幅度分别达 7.2% 和 27.8%。
- 对比优势:实证显示 DiffsFormer 的收益表现和稳定性明显优于随机高斯噪声和 Shake-shake 等增强方法,且引入损失引导加噪可进一步提升信息比率(IR)。
局限性/风险:
- 外推能力有限:生成样本依赖历史分布,对全新市场环境的适应性需持续跟踪。
- 参数敏感性:编辑步 T' 的取值需在保真度与多样性之间进行权衡,存在调参风险。
- 实盘约束:合成数据训练存在潜在的数据泄漏风险,且原文未充分扣除交易成本、滑点及考虑策略容量,实盘净收益有待检验。