[論文レビュー] Application of deep reinforcement learning for Indian stock trading automation
本論文は、10種類のインド株式データセットを用いて、深層強化学習(DRL)を用いてインド市場における自動株式取引を実装している。3つのDRLモデル—Deep Q-Network(DQN)、Double DQN(DDQN)、Dueling Double DQN—を用いて検証した。Dueling Double DQNモデルが利益の生成と安定性の両面で他を上回り、歴史的価格およびテクニカルインジケータデータからの適応的取引意思決定によって長期収益を最大化する優れた性能を示した。
In stock trading, feature extraction and trading strategy design are the two important tasks to achieve long-term benefits using machine learning techniques. Several methods have been proposed to design trading strategy by acquiring trading signals to maximize the rewards. In the present paper the theory of deep reinforcement learning is applied for stock trading strategy and investment decisions to Indian markets. The experiments are performed systematically with three classical Deep Reinforcement Learning models Deep Q-Network, Double Deep Q-Network and Dueling Double Deep Q-Network on ten Indian stock datasets. The performance of the models are evaluated and comparison is made.
研究の動機と目的
- 深層強化学習を用いてインド株式市場における自動株式取引意思決定を実現すること。
- 実世界のインド株式データを用いて、3つのDRLモデル—DQN、Double DQN、Dueling Double DQN—の性能を評価・比較すること。
- 歴史的価格およびテクニカルインジケータデータから導出される適応的取引戦略を通じて、長期的利益を最大化すること。
- 後続の時間帯の未観測データを用いたテストにより、モデルの一般化能力を検証すること。
- 高頻度で非定常な金融市場におけるDRLモデルの頑健性と安定性を評価すること。
提案手法
- DRLエージェントは、経験リプレイとターゲットネットワークを用いたDeep Q-Network(DQN)アーキテクチャを採用し、学習の安定化とQ値の過大評価低減を図っている。
- Double DQNは、行動選択(オンラインネットワークから)と価値推定(ターゲットネットワークから)を分離することで安定性を向上させ、過大評価バイアスを低減する。
- Dueling Double DQNは、価値関数とアドバンテージ関数を分離することで、より良い状態評価と行動選択を可能にし、性能をさらに向上させる。
- モデルは90日間の履歴株価データを用いて学習させ、ハイパーパrameterとしてバッチサイズ64、学習率0.00025、エプソン減衰率0.995を設定した。
- 環境は、テクニカルインジケータと価格変動を含む状態特徴によって定義され、行動は「買い」「売り」「ホールド」に分類される。
- エージェントの性能は、訓練データおよび未観測のテストデータにおける総利益と累積報酬を用いて評価された。
実験結果
リサーチクエスチョン
- RQ1DQN、Double DQN、Dueling Double DQNは、インド株式取引自動化においてどのように利益を生成するか?
- RQ2ボラティリティの高いインド株式市場において、どのDRLモデルアーキテクチャが未観測テストデータに対する最も高い安定性と一般化能力を示すか?
- RQ3深層強化学習は、長期的株式取引意思決定において、従来のテクニカル分析や機械学習手法をどの程度上回ることができるか?
- RQ4経験リプレイとターゲットネットワークの使用は、高頻度で非定常な金融データにおける収束性と性能にどのように影響するか?
- RQ5Dueling Double DQNの価値・アドバンテージ分解は、標準DQNおよびDouble DQNに比べ、より優れた行動選択と高い累積報酬をもたらすか?
主な発見
- Dueling Double DQNモデルは、10種類のインド株式の全般で最高の平均テスト利益を達成した。NESTLEINDではテスト利益101,731、ULTRACEMCOでは57,626を記録した。
- Double DQNは、訓練段階およびテスト段階の両方で標準DQNを上回った。TCSではテスト利益38,095、ULTRACEMCOでは57,626を記録したのに対し、DQNはそれぞれ4,770および25,188であった。
- 平均して、Dueling Double DQNはDQN(TCS:22、NESTLEIND:-180)よりも顕著に高いテスト報酬(TCS:114、NESTLEIND:79)を達成し、より優れた方策学習が行われたことが示された。
- Dueling Double DQNモデルは、特にULTRACEMCOデータセットにおいて、最も安定した学習損失と一貫性のある報酬推移を示した(図5参照)。
- 訓練データでは強力なパフォーマンスを示したが、DQNはいくつかの銘柄(例:TECHM:-678)で高い分散と負のテスト利益を示し、過学習と不安定性が確認された。
- モデルは市場のボラティリティへの高い適応性を示し、多様な銘柄において、利益および報酬指標の両面でDueling Double DQNが他を常に上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。