Skip to main content
QUICK REVIEW

[論文レビュー] Improved Method of Stock Trading under Reinforcement Learning Based on DRQN and Sentiment Indicators ARBR

Peng Zhou, Jingling Tang|arXiv (Cornell University)|Nov 19, 2021
Stock Market Forecasting Methods被引用数 4
ひとこと要約

本稿では、中国の非効率的市場における記憶制限および非合理的投資家行動を解消するために、長短期記憶(LSTM)ネットワークとARBRセンチメント指標を統合した、株式取引向けに改善された深層強化学習モデル、DRQN-ARBRを提案する。このモデルは、状態表現の向上と長期依存関係の学習により、従来のDQNを上回る取引パフォーマンスを実現する。

ABSTRACT

With the application of artificial intelligence in the financial field, quantitative trading is considered to be profitable. Based on this, this paper proposes an improved deep recurrent DRQN-ARBR model because the existing quantitative trading model ignores the impact of irrational investor behavior on the market, making the application effect poor in an environment where the stock market in China is non-efficiency. By changing the fully connected layer in the original model to the LSTM layer and using the emotion indicator ARBR to construct a trading strategy, this model solves the problems of the traditional DQN model with limited memory for empirical data storage and the impact of observable Markov properties on performance. At the same time, this paper also improved the shortcomings of the original model with fewer stock states and chose more technical indicators as the input values of the model. The experimental results show that the DRQN-ARBR algorithm proposed in this paper can significantly improve the performance of reinforcement learning in stock trading.

研究の動機と目的

  • 従来のDQNモデルが株式取引応用において長期依存関係を処理できず記憶能力に制限を受ける問題に対処すること。
  • 中国の非効率的株式市場における非合理的投資家行動をモデル化するために、特にARBRを含めたセンチメント指標を統合すること。
  • 基本的な価格データに加えて複数のテクニカルインジケーターを含めるなど、株式状態の表現を向上させること。
  • DRQNの完全結合層をLSTM層に置き換えることで、時間的特徴の学習を向上させ、モデルのパフォーマンスを向上させること。
  • 実世界の取引シナリオにおけるDRQN-ARBRモデルの有効性を、実証的バックテストを通じて検証すること。

提案手法

  • DRQNの完全結合層をLSTM層に置き換えることで、順序データのモデリングと記憶保持を向上させること。
  • 投資家行動に影響を受ける市場センチメントを捉えるために、ARBRセンチメント指標を追加の入力特徴として統合すること。
  • 価格と出来高に加えて、複数のテクニカルインジケーターを組み込むことで、入力状態空間を拡張し、特徴表現を豊かにすること。
  • 累積ポートフォリオリターンに基づく報酬関数を用いた強化学習フレームワークでDRQN-ARBRモデルを訓練すること。
  • 標準的なDQNおよびDRQNアーキテクチャと同様に、経験リプレイとターゲットネットワークを用いて学習を安定化させること。
  • 探索と活用のバランスを取るために、減衰スケジュールを用いたエプソン-グリーディ探索を適用すること。

実験結果

リサーチクエスチョン

  • RQ1DRQNの完全結合層をLSTM層に置き換えることで、株式取引タスクにおけるパフォーマンスが向上するか?
  • RQ2ARBRセンチメント指標を統合することで、非効率的市場における取引戦略のパフォーマンスはどの程度向上するか?
  • RQ3複数のテクニカルインジケーターを用いて入力状態空間を拡張すると、モデルの学習および収益性にどのような影響を与えるか?
  • RQ4DRQN-ARBRモデルは、累積リターンおよびリスク調整済みパフォーマンスの観点から、標準DQNおよびDRQNを上回るか?
  • RQ5DRQN-ARBRモデルは、異なる市場状況およびデータ分布に対してどの程度頑健か?

主な発見

  • バックテストによる中国株式市場データの分析において、DRQN-ARBRモデルはベースラインのDQNおよびDRQNモデルと比較して、顕著に優れた取引パフォーマンスを示した。
  • ARBRセンチメント指標の統合により、特に非合理的投資家行動が顕著な時期において、市場センチメントの変化に適応する能力が向上した。
  • 完全結合層の代わりにLSTMを用いることで、時系列価格およびセンチメントデータにおける長期依存関係の学習能力が向上した。
  • 複数のテクニカルインジケーターを含む拡張された入力状態空間は、より的確な取引意思決定と向上した戦略の頑健性に寄与した。
  • 実験的評価において、DRQN-ARBRモデルは高い累積リターンと、シャープレシオを含むより優れたリスク調整済みパフォーマンス指標を達成した。
  • 結果から、DRQN-ARBRは、非マルコフ的かつ非効率的市場環境下での従来のDQNの制限を効果的に是正できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。