[论文解读] Optimizing Trading Strategies in Quantitative Markets using Multi-Agent Reinforcement Learning
本文提出了 CPPI-MADDPG 和 TIPP-MADDPG 两种新型多智能体强化学习框架,将恒定比例投资组合保险(CPPI)和时间不变投资组合保护(TIPP)策略与多智能体深度确定性策略梯度(MADDPG)算法相结合。在深圳证券交易所的 100只真实股票上进行评估,两种方法均优于传统策略和基线强化学习模型,其中 TIPP-MADDPG 实现了最高的年化收益率(9.68%),而 CPPI-MADDPG 则取得了最佳夏普比率(2.18)。
Quantitative markets are characterized by swift dynamics and abundant uncertainties, making the pursuit of profit-driven stock trading actions inherently challenging. Within this context, reinforcement learning (RL), which operates on a reward-centric mechanism for optimal control, has surfaced as a potentially effective solution to the intricate financial decision-making conundrums presented. This paper delves into the fusion of two established financial trading strategies, namely the constant proportion portfolio insurance (CPPI) and the time-invariant portfolio protection (TIPP), with the multi-agent deep deterministic policy gradient (MADDPG) framework. As a result, we introduce two novel multi-agent RL (MARL) methods, CPPI-MADDPG and TIPP-MADDPG, tailored for probing strategic trading within quantitative markets. To validate these innovations, we implemented them on a diverse selection of 100 real-market shares. Our empirical findings reveal that the CPPI-MADDPG and TIPP-MADDPG strategies consistently outpace their traditional counterparts, affirming their efficacy in the realm of quantitative trading.
研究动机与目标
- 为应对高频、不确定且动态变化的量化交易环境,此类环境中人类交易员易做出非理性决策。
- 通过将成熟的金融风险控制策略——CPPI 和 TIPP——整合入多智能体强化学习框架,提升波动市场中的投资组合管理能力。
- 评估将基于规则的投资组合保护机制与 MARL 融合后,是否能相较于标准强化学习和传统投资组合方法,获得更优的风险调整后收益。
- 通过在 100只深圳证券交易所股票上的实证回测,证明 CPPI-MADDPG 和 TIPP-MADDPG 在真实市场条件下的有效性。
提出的方法
- 该框架将策略交易建模为一个涉及 N 个智能体的随机博弈,每个智能体观察共享状态向量 s = [p, h, b],代表股票价格、持仓量和现金余额。
- 每个智能体使用策略网络 πθi 根据其观测选择动作(投资组合权重),且动作受 CPPI 或 TIPP 基于规则的保险逻辑约束。
- 对 MADDPG 算法进行改进,引入集中式评论家,使其能够观测联合动作与状态,从而实现信用分配并提升联合策略学习效果。
- 经验回放缓冲区存储转移数据 ⟨s, a, r, s′⟩,目标网络通过 τ = 0.01 的软更新规则进行更新,以稳定训练过程。
- 动作选择过程通过噪声过程 𝒩 实现探索,若动作超出基于规则的策略 Φ(s) 的范围,则进行裁剪或调整以满足 CPPI/TIPP 约束。
- 评论家通过最小化公式 (4) 中的损失进行训练,而智能体则使用公式 (3) 中的策略梯度进行更新,两者均采用双 Q 目标估计方法。
实验结果
研究问题
- RQ1将 CPPI 和 TIPP 风险控制机制与多智能体深度强化学习结合,是否能提升量化交易环境中的投资组合表现?
- RQ2CPPI-MADDPG 和 TIPP-MADDPG 在风险调整后收益方面,相较于基线强化学习方法(如 MADDPG、MADQN)和传统策略(如 Universal Portfolios)表现如何?
- RQ3与无约束的强化学习智能体相比,引入基于规则的投资组合保险是否能增强稳定性并降低回撤?
- RQ4CPPI(存在缺口风险)和 TIPP(基于时间的底线)的差异化风险特征如何影响混合 MARL 模型的性能?
- RQ5通过参数调节能在多大程度上使混合模型适应不同投资者的风险偏好?
主要发现
- TIPP-MADDPG 实现了 9.68% 的最高年化收益率,显著优于 Universal Portfolio(3.36%)和 MADDPG(8.22%)。
- CPPI-MADDPG 获得了 2.18 的最佳夏普比率,表明其风险调整后表现优于 TIPP-MADDPG(2.09)和 MADDPG(1.99)。
- CPPI-MADDPG 记录了最低的最大回撤(6.60%),显示出强于 TIPP-MADDPG(9.02%)和 MADDPG(12.26%)的下行风险保护能力。
- TIPP-MADDPG 策略在第 80 至 160 个交易日之间表现出明显的业绩跃升,表明其对市场趋势具有良好的响应能力。
- 基于 MADDPG 的智能体表现出更均匀的资产配置,而 CPPI-MADDPG 和 TIPP-MADDPG 智能体则采用更稀疏、基于规则的配置,体现出战略性的风险控制特征。
- 在特定参数设置下,混合模型能成功恢复至基线 MADDPG 的性能水平,证实了其在风险偏好调节方面的灵活性与可控性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。