Skip to main content
QUICK REVIEW

[論文レビュー] Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution

Rundong Wang, Hongxin Wei|arXiv (Cornell University)|Dec 23, 2020
Advanced Bandit Algorithms Research参考文献 19被引用数 4
ひとこと要約

本稿では、価格スリッページなどの取引コストを最小限に抑えながら長期的なリターンを最適化するため、ポートフォリオ管理と注文執行を分離する階層的強化学習フレームワークHRPMを提案する。時間窓内での再バランス(高レベル)と執行(低レベル)のポリシーを別々に学習することで、米国および中国市場において最先端手法を大きく上回る性能を達成し、年間リターン48.7%、リスク調整指標において優れた結果を示した。

ABSTRACT

Portfolio management via reinforcement learning is at the forefront of fintech research, which explores how to optimally reallocate a fund into different financial assets over the long term by trial-and-error. Existing methods are impractical since they usually assume each reallocation can be finished immediately and thus ignoring the price slippage as part of the trading cost. To address these issues, we propose a hierarchical reinforced stock trading system for portfolio management (HRPM). Concretely, we decompose the trading process into a hierarchy of portfolio management over trade execution and train the corresponding policies. The high-level policy gives portfolio weights at a lower frequency to maximize the long term profit and invokes the low-level policy to sell or buy the corresponding shares within a short time window at a higher frequency to minimize the trading cost. We train two levels of policies via pre-training scheme and iterative training scheme for data efficiency. Extensive experimental results in the U.S. market and the China market demonstrate that HRPM achieves significant improvement against many state-of-the-art approaches.

研究の動機と目的

  • 既存の強化学習手法が価格スリッページを無視し、即時執行を仮定しているという限界を是正すること。
  • 実世界のポートフォリオマネージャーとトレーダーの階層的役割を反映するため、長期的再バランスと短期的執行という二段階の意思決定プロセスを構造化すること。
  • エントロピー正則化を用いた反復的トレーニングと低レベルポリシーの事前学習により、データ効率性と性能を向上させること。
  • 多様な市場環境、特に高ボラティリティ環境を想定した実証的検証を通じて、本フレームワークの優位性を実証すること。

提案手法

  • HRPMは、取引コストを含むポートフォリオ管理を階層的マルコフ意思決定過程(HMDP)として定式化し、長期的なポートフォリオウェイト意思決定と短期的な執行行動を分離する。
  • 高レベルポリシーは低頻度で動作し、最適なポートフォリオウェイトを決定し、低レベルポリシーの実行をトリガーする。
  • 低レベルポリシーは、複数の次元の行動(購入・売却数量および価格)を扱えるようにアクションブランチを採用し、事前学習と反復的ファインチューニングのスキームで学習される。
  • 高レベルポリシーにはエントロピーボーナスを導入し、ポートフォリオの分散化を促進し、リスク露出を低減する。
  • フレームワークは指値きろデータを活用し、スリッページを含む実際の取引コストを報酬関数に統合する。
  • トレーニングは米国および中国の株式市場の歴史的価格データおよび指値きろデータを用い、現実世界への適用可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習フレームワークは、長期的ポートフォリオ最適化と短期的注文執行を有効に分離することで、取引コストを低減できるか?
  • RQ2価格スリッページは取引コストの無視できない要因であり、現実的な性能を実現するには明示的にモデル化する必要があるか?
  • RQ3高レベルポリシーにエントロピーボーナスを組み込むことで、リスク分散と全体的なポートフォリオ安定性が向上するか?
  • RQ4異なる市場環境下において、HRPMは最先端手法と比較してリターン、リスク調整性能、およびロバストネスの点で優れているか?
  • RQ5低レベルポリシーの事前学習と反復的ファインチューニングは、データ効率性と全体的なシステム性能をどの程度向上させるか?

主な発見

  • 中国市場ではHRPMが年間リターン48.742%を達成し、次善のベースライン(DPM)を13%、市場インデックス(SSE50)を42%上回った。
  • 米国市場では、エントロピーボーナス係数η=0.05の設定で年間リターン27.089%を記録し、全テスト設定の中で最高を記録した。
  • HRPMは優れたリスク管理を示し、米国市場で最大下落率(MDD)0.117を記録し、ボラティリティの高い環境下でも安定したパフォーマンスを維持した。
  • アブレーションスタディの結果、手数料だけでは総取引コストを十分に捉えられず、特に大規模な取引ではスリッページが主要な要因であることが判明した。
  • エントロピーボーナスはリスク調整リターンを顕著に改善し、η=0.05が最高のARR、η=0.1が最小のMDDを記録し、効果的なリスク分散が実現された。
  • 低レベルポリシー行動の可視化分析から、価格ピークで戦略的に売却し、局所的トレイルで買いを実行する行動パターンが確認され、悪影響を及ぼす価格インパクトを低減し、執行品質を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。