[论文解读] Deep Reinforcement Learning for Trading
本文提出了一种深度强化学习(DRL)框架,用于在多个资产类别中学习连续期货合约的最优交易策略。通过使用DQN、PG和A2C算法,直接将市场状态映射为交易头寸,并采用波动率归一化的奖励函数,该方法在高交易成本下仍能实现正的风险调整收益,表现优于经典动量策略,在商品、股票、固定收益和外汇市场中均表现出稳健性能。
We adopt Deep Reinforcement Learning algorithms to design trading strategies for continuous futures contracts. Both discrete and continuous action spaces are considered and volatility scaling is incorporated to create reward functions which scale trade positions based on market volatility. We test our algorithms on the 50 most liquid futures contracts from 2011 to 2019, and investigate how performance varies across different asset classes including commodities, equity indices, fixed income and FX markets. We compare our algorithms against classical time series momentum strategies, and show that our method outperforms such baseline models, delivering positive profits despite heavy transaction costs. The experiments show that the proposed algorithms can follow large market trends without changing positions and can also scale down, or hold, through consolidation periods.
研究动机与目标
- 开发一种深度强化学习框架,直接从市场状态学习最优交易头寸,避免显式预测。
- 研究DRL算法(DQN、PG和A2C)在具有离散和连续动作空间的多样化期货市场中的有效性。
- 通过波动率缩放改进奖励函数,以根据市场波动率动态调整头寸规模。
- 在不同资产类别(商品、股票指数、固定收益、外汇)及现实交易成本下评估性能。
- 展示基于DRL的策略在趋势市场和均值回归市场中的鲁棒性与一致性。
提出的方法
- 框架使用时间序列动量和各类技术指标(如MACD、收益率符号)生成状态表征,以编码市场状况。
- 采用三种DRL算法:深度Q网络(DQN)、策略梯度(PG)和优势演员-critic(A2C),支持离散与连续动作空间。
- 通过波动率缩放增强奖励函数,使波动率低时增加头寸规模,波动率高时减少头寸规模。
- 效用函数为线性(风险中性),与强化学习最大化预期累积收益的目标一致,符合现代投资组合理论。
- 在奖励函数中显式建模交易成本,以反映现实市场摩擦。
- 在2011至2019年间50个流动性良好的期货合约上评估性能,涵盖多个资产类别,使用夏普比率和每轮换手的平均收益等指标。
实验结果
研究问题
- RQ1深度强化学习算法能否在不进行显式预测的情况下,直接从市场状态学习到盈利的交易策略?
- RQ2在不同资产类别中,具有离散与连续动作空间的DRL模型在性能上如何比较?
- RQ3奖励函数中引入波动率缩放在多大程度上提升了交易表现与鲁棒性?
- RQ4在高交易成本下,基于DRL的策略能否超越经典的时间序列动量策略?
- RQ5结果在单个合约与不同资产类别之间的一致性如何?
主要发现
- 基于DRL的策略,特别是DQN和A2C,在所有资产类别中均优于经典动量策略,实现了正的年化夏普比率。
- DQN在所有合约上实现了1.288的平均年化夏普比率,累计收益达2.220,即使在25个基点的交易成本下仍表现优异。
- A2C算法实现了1.785的累计收益和1.050的年化夏普比率,表明其在趋势市场中表现强劲。
- 模型在商品、股票指数、固定收益和外汇市场中均保持一致表现,各板块夏普比率在0.517至1.048之间。
- 即使在25个基点的交易成本下(相当于每份合约约3.5美元),DQN和A2C仍实现正利润,表明对市场摩擦具有强鲁棒性。
- 箱线图分析确认,表现并非由单一高收益合约驱动,表明模型在各单独金融工具上均具有一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。