Skip to main content
QUICK REVIEW

[论文解读] Application of deep reinforcement learning for Indian stock trading automation

Supriya Bajpai|arXiv (Cornell University)|May 18, 2021
Stock Market Forecasting Methods被引用 9
一句话总结

本文将深度强化学习(DRL)应用于印度股市的自动化股票交易,使用三种DRL模型——深度Q网络(DQN)、双DQN(DDQN)和双Dueling DQN——在十个印度股票数据集上进行实验。双Dueling DQN模型在盈利生成和稳定性方面优于其他模型,通过自适应交易决策展现出在最大化长期回报方面的卓越性能。

ABSTRACT

In stock trading, feature extraction and trading strategy design are the two important tasks to achieve long-term benefits using machine learning techniques. Several methods have been proposed to design trading strategy by acquiring trading signals to maximize the rewards. In the present paper the theory of deep reinforcement learning is applied for stock trading strategy and investment decisions to Indian markets. The experiments are performed systematically with three classical Deep Reinforcement Learning models Deep Q-Network, Double Deep Q-Network and Dueling Double Deep Q-Network on ten Indian stock datasets. The performance of the models are evaluated and comparison is made.

研究动机与目标

  • 使用深度强化学习自动化印度股市的股票交易决策。
  • 基于真实世界中的印度股票数据,评估并比较三种DRL模型——DQN、双DQN和双Dueling DQN——的性能。
  • 通过从历史价格和指标数据中衍生出的自适应交易策略,最大化长期利润。
  • 通过在后续时间段的未见数据上进行测试,验证模型的泛化能力。
  • 评估DRL模型在高度波动、随机性的金融市场中的鲁棒性和稳定性。

提出的方法

  • DRL智能体采用深度Q网络(DQN)架构,结合经验回放和目标网络,以稳定训练过程并减少Q值的过估计。
  • 双DQN通过将动作选择(来自在线网络)与价值估计(来自目标网络)解耦,提升了稳定性,减少了过估计偏差。
  • 双Dueling DQN通过分离价值函数与优势函数,进一步提升性能,实现更优的状态评估与动作选择。
  • 模型在90天的历史股票数据窗口上进行训练,超参数包括批量大小64、学习率0.00025以及ε衰减率0.995。
  • 环境由包括技术指标和价格变动在内的状态特征定义,动作被划分为‘买入’、‘卖出’或‘持有’。
  • 通过在训练数据和未见测试数据上的总利润与累积奖励,评估智能体的性能。

实验结果

研究问题

  • RQ1DQN、双DQN和双Dueling DQN在印度股市自动化交易中的盈利表现如何?
  • RQ2在波动性较高的印度股市中,哪种DRL模型架构在未见测试数据上展现出最高的稳定性和泛化能力?
  • RQ3深度强化学习在长期股票交易决策中,能在多大程度上超越传统技术分析和机器学习方法?
  • RQ4经验回放和目标网络的使用如何影响高频、非平稳金融数据中的收敛性和性能?
  • RQ5双Dueling DQN的价值-优势分解是否能带来比标准DQN和双DQN更优的动作选择与更高的累积回报?

主要发现

  • 双Dueling DQN模型在所有十个印度股票中均实现了最高的平均测试利润,其中NESTLEIND的测试利润为101,731,ULTRACEMCO为57,626。
  • 双DQN在训练和测试阶段均优于标准DQN,TCS的测试利润为38,095(DQN为4,770),ULTRACEMCO为57,626(DQN为25,188)。
  • 平均而言,双Dueling DQN生成的测试奖励显著更高(TCS为114,NESTLEIND为79),而DQN分别为22和-180,表明其策略学习能力更强。
  • 双Dueling DQN模型表现出最稳定的训练损失和一致的奖励进展,尤其在ULTRACEMCO数据集上表现突出,如图5所示。
  • 尽管在训练数据上表现强劲,DQN在多个股票上显示出高方差和负的测试利润(如TECHM为-678),表明存在过拟合和不稳定性。
  • 各模型在应对市场波动方面表现出强适应能力,双Dueling DQN在各类股票中均持续优于其他模型,无论在盈利还是奖励指标上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。