[論文レビュー] A Novel Deep Reinforcement Learning Based Automated Stock Trading System Using Cascaded LSTM Networks
本論文は、財務時系列データから時間的特徴を抽出するためのスタックドLSTMを統合した、段階的LSTM正則化Proximal Policy Optimization(CLSTM-PPO)モデルを提案する。このモデルは、強化学習による自動株式取引に適応し、ベースラインと比較して累積リターンが5–52%向上し、最大利益率も8–52%向上する。特に中国市場において顕著な性能向上を示し、累積リターンが84.4%向上、シャープレシオも37.4%向上した。
More and more stock trading strategies are constructed using deep reinforcement learning (DRL) algorithms, but DRL methods originally widely used in the gaming community are not directly adaptable to financial data with low signal-to-noise ratios and unevenness, and thus suffer from performance shortcomings. In this paper, to capture the hidden information, we propose a DRL based stock trading system using cascaded LSTM, which first uses LSTM to extract the time-series features from stock daily data, and then the features extracted are fed to the agent for training, while the strategy functions in reinforcement learning also use another LSTM for training. Experiments in DJI in the US market and SSE50 in the Chinese stock market show that our model outperforms previous baseline models in terms of cumulative returns and Sharp ratio, and this advantage is more significant in the Chinese stock market, a merging market. It indicates that our proposed method is a promising way to build a automated stock trading system.
研究の動機と目的
- 株式取引における深層強化学習(DRL)の直接的適用を妨げる、信号対雑音比の低さと非定常性という課題に対処する。
- 教師あり学習手法が直面する過学習や市場状態のラベル依存性といった限界を克服する。
- 事前にラベル付けされた市場方向性を必要とせず、動的に最適な買付・売却行動を学習するDRLベースの自動取引システムを開発する。
- DRLフレームワークに段階的LSTMによる時系列特徴抽出を統合することで、モデルの汎化性能と収益性を向上させる。
- 米国、中国、インド、英国の多様な市場を対象に評価し、先進国および新興国株式市場におけるモデルの頑健性と性能を検証する。
提案手法
- 日次株価データ(価格、出来高、テクニカルインジケーター:MACD、RSI、CCI、ADX)から階層的時間的特徴を抽出するため、段階的LSTM(CLSTM)アーキテクチャを採用する。
- 抽出された特徴を、マーカフド決定過程(MDP)フレームワーク内におけるProximal Policy Optimization(PPO)エージェントの初期状態表現として使用する。
- 取引タスクを、調整済み価格、現金残高、株式保有数、テクニカルインジケーターで定義された状態を持つMDPとして定式化する。
- ポートフォリオリターンに基づく報酬関数を用いてPPOエージェントを訓練する。リスクとリターンのバランスを改善するため、シャープレシオ正規化による潜在的な改善も検討する。
- 一貫した訓練環境と評価指標を確保するため、マルチエージェントアンサンブル戦略をベースラインとして実装する。
- 特に長期間のDRLポリシー学習に適した安定性を確保するため、最小7年分の歴史的データ窓を用いる。
実験結果
リサーチクエスチョン
- RQ1段階的LSTMアーキテクチャは、ノイズが多く非定常な財務時系列から意味のある時間的パターンを効果的に抽出でき、DRLベースの取引ポリシー学習を向上させることができるか?
- RQ2CLSTM-PPOモデルは、複数のグローバル市場における累積リターン、リスク調整後パフォーマンス、1取引あたりの収益性という観点から、既存のDRLおよびアンサンブルベースの取引戦略と比較してどのように差をつけるか?
- RQ3モデルのパフォーマンス優位性は、特に中国のA株市場のような高ボラティリティ環境における先進国市場と新興国市場で顕著に異なるか?
- RQ4LSTMベースの特徴抽出の統合は、自動取引の強化学習において、エージェントの汎化能力を高め、過学習を回避する能力をどの程度向上させるか?
- RQ5報酬関数の正規化(例:シャープレシオの使用)は、リターンの潜在的損失を犠牲にせず、訓練の安定性を向上させ、最大下落幅を低減できるか?
主な発見
- CLSTM-PPOモデルは、全テスト市場でベースラインと比較して累積リターンが5%~52%向上し、特に中国市場で顕著な向上を示した。累積リターンは84.4%向上した。
- 最大利益率はベースラインと比較して8%~52%向上し、特にトレンド市場における利益捕捉能力が強化された。
- 1取引あたりの平均収益性は6%~14%向上し、個々の取引における意思決定の質の向上が示された。
- 中国市場ではシャープレシオがアンサンブルベースラインと比較して37.4%向上し、新興市場におけるリスク調整後パフォーマンスの優位性が裏付けられた。
- 4か国の市場すべてで、平均自己資本利益率(MER)と1取引あたり平均利益(APPT)の両面で第1位を獲得し、段階的LSTMによる特徴抽出の有効性が確認された。
- 英国市場では、7年未満の不足した訓練データのためパフォーマンスが制限された。これは、長期間のDRL訓練において、最適収束のための十分な歴史的データが必要であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。