强化学习◆ AI 生成 · 已溯源
EVOQUANT:基于自演化验证器引导的量化交易策略优化框架

结论前置 / TL;DR
EVOQUANT 提出一种 LLM 驱动、验证器闭环控制的自演化策略优化框架,在七类实证策略(A 股 ×4 + 加密货币 ×3)上将平均测试夏普比率从 -0.298 提升至 0.538,最优策略实现 199% 相对提升,显著缓解 LLM 直接改写导致的幻觉编辑、策略漂移与回测过拟合问题。
核心贡献:解决 LLM 在量化策略优化中的可信性瓶颈
EVOQUANT 并非简单调用 LLM 重写策略代码,而是构建「诊断—生成—验证—蒸馏」四阶段闭环:LLM 深度分析策略性能瓶颈(如特定市场周期下的最大回撤源),生成语义受控的候选修改(例如仅调整止盈逻辑而不变更仓位模型),再经多阶段验证管道(含模拟交易一致性检验、风险指标鲁棒性评估、跨周期泛化性测试)筛选最优版本,最终将成功优化模式以结构化知识形式蒸馏为可复用的优化规则库,支撑持续自演化。
实证效果:跨资产类别稳健增益
- 测试覆盖 A 股市场(中证500择时、沪深300动量、行业轮动、高频价量)与 加密货币市场(BTC/USDT 均值回归、ETH/USDT 波动率套利、稳定币息差套利)共 7 类代表性策略;
- 关键指标:平均测试期 Sharpe ratio 从 -0.298 提升至 0.538(Δ = +0.836),最优策略相对提升达 199%;
- 消融实验验证各模块必要性:移除验证器模块导致 Sharpe 下降 42.7%,禁用知识蒸馏使后续迭代优化效率衰减 68%。
方法论定位:强化学习与 LLM 协同的新范式
该工作发表于 arXiv:2607.12455v1,将 LLM 视为策略空间的智能探索器(explorer),而验证器(verifier)承担策略演化的 critic 与 reward shaping 角色,本质是 LLM-Augmented RL for Algorithmic Trading —— 区别于端到端微调或提示工程,强调可解释、可审计、可累积的策略进化路径。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12455