[论文解读] Deep Reinforcement Learning for Cryptocurrency Trading: Practical Approach to Address Backtest Overfitting
本文提出了一种假设检验框架,用于检测并拒绝加密货币交易中过拟合的深度强化学习(DRL)智能体。通过组合交叉验证和基于logit的统计检验估算过拟合概率,该方法识别出具有鲁棒性的智能体——PPO在累计收益上比基准高出24%,并在2022年5月至6月的两次市场暴跌期间表现出更低的波动性。
Designing profitable and reliable trading strategies is challenging in the highly volatile cryptocurrency market. Existing works applied deep reinforcement learning methods and optimistically reported increased profits in backtesting, which may suffer from the false positive issue due to overfitting. In this paper, we propose a practical approach to address backtest overfitting for cryptocurrency trading using deep reinforcement learning. First, we formulate the detection of backtest overfitting as a hypothesis test. Then, we train the DRL agents, estimate the probability of overfitting, and reject the overfitted agents, increasing the chance of good trading performance. Finally, on 10 cryptocurrencies over a testing period from 05/01/2022 to 06/27/2022 (during which the crypto market crashed two times), we show that the less overfitted deep reinforcement learning agents have a higher return than that of more overfitted agents, an equal weight strategy, and the S&P DBM Index (market benchmark), offering confidence in possible deployment to a real market.
研究动机与目标
- 解决DRL驱动的加密货币交易策略中后向测试过拟合这一关键问题,该问题会导致虚假的性能声明。
- 开发一种实用且量化的评估方法,以超越标准后向测试验证,衡量DRL智能体的泛化能力。
- 通过拒绝高过拟合概率的智能体来提高模型可靠性,从而增强在真实市场部署中的信心。
- 证明在市场波动剧烈期间,过拟合程度较低的智能体相比传统方法和市场指数能实现更优的风险调整后收益。
提出的方法
- 将后向测试过拟合检测建模为一个统计假设检验,原假设假设不存在过拟合,备择假设假设存在过拟合。
- 使用组合交叉验证来模拟多样的市场状态,并通过分析样本外(OOS)性能相对于样本内(IS)性能的分布,估算过拟合概率。
- 对各折中样本外性能的相对排名应用logit变换,以建模过拟合概率,更高的logit值表示更好的泛化能力。
- 设定显著性水平α(例如10%),拒绝估计过拟合概率超过该值的智能体,确保仅保留鲁棒智能体。
- 使用相同的训练集划分和超参数搜索空间,训练并评估多个DRL智能体(PPO、TD3、SAC),以比较其过拟合风险与性能表现。
- 集成动态风险控制机制:当CVIX指标超过90时,智能体停止买入并平仓所有头寸,以在极端波动期间限制回撤。
实验结果
研究问题
- RQ1统计假设检验能否有效检测DRL驱动的加密货币交易智能体中的后向测试过拟合?
- RQ2在不同DRL算法和超参数配置下,过拟合概率与实际样本外性能之间是否存在相关性?
- RQ3过拟合概率估计较低的智能体是否在真实市场压力事件中实现更高的累计收益和更低的波动性?
- RQ4组合交叉验证是否在检测金融DRL任务中的过拟合方面优于传统的向前滚动和K折交叉验证?
- RQ5在市场崩盘期间,过拟合概率与DRL智能体鲁棒性之间是否存在一致关系?
主要发现
- 采用所提组合交叉验证方法训练的PPO智能体,在2022年5月至6月期间实现了-34.96%的累计收益,显著优于标普DBM指数(-50.78%)和等权重策略(-47.78%)。
- PPO智能体在所有智能体中波动率最低(2.01e-3),表明其在市场动荡期间具备更优的风险控制能力。
- PPO的过拟合概率估计为8.0%,低于10%的阈值,因此被判定为非过拟合智能体而被接受。
- SAC智能体的过拟合概率最高(21.3%),超过阈值,因此被拒绝为不可靠智能体。
- TD3在≈4附近表现出logit值的高度集中,表明其样本内与样本外性能之间具有强一致性,支持其鲁棒性。
- 所提方法成功识别出PPO为最可靠的智能体,其累计收益比次优智能体(TD3)高出24%,且在风险调整后表现显著优于所有基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。