[論文レビュー] A Deep Reinforcement Learning Framework for the Financial Portfolio Management Problem
本論文は、オンライン学習と明示的報酬を備えたマルチ資産ポートフォリオ管理のためのモデルフリーの深層強化学習フレームワーク(EIIE)を提案し、CNN、RNN、LSTM実装を用いた暗号資産バックテストでトップパフォーマンスを示す。
Financial portfolio management is the process of constant redistribution of a fund into different financial products. This paper presents a financial-model-free Reinforcement Learning framework to provide a deep machine learning solution to the portfolio management problem. The framework consists of the Ensemble of Identical Independent Evaluators (EIIE) topology, a Portfolio-Vector Memory (PVM), an Online Stochastic Batch Learning (OSBL) scheme, and a fully exploiting and explicit reward function. This framework is realized in three instants in this work with a Convolutional Neural Network (CNN), a basic Recurrent Neural Network (RNN), and a Long Short-Term Memory (LSTM). They are, along with a number of recently reviewed or published portfolio-selection strategies, examined in three back-test experiments with a trading period of 30 minutes in a cryptocurrency market. Cryptocurrencies are electronic and decentralized alternatives to government-issued money, with Bitcoin as the best-known example of a cryptocurrency. All three instances of the framework monopolize the top three positions in all experiments, outdistancing other compared trading algorithms. Although with a high commission rate of 0.25% in the backtests, the framework is able to achieve at least 4-fold returns in 50 days.
研究の動機と目的
- 価格予測を回避するモデルフリーRLソリューションをポートフォリオ管理問題に提供する。
- 取引コストと過去のポートフォリオ情報を学習フレームワークに組み込む。
- 複数資産を扱い市場間でのオンライン学習に対応できるスケーラブルなアーキテクチャ(EIIE)を開発する。
- 暗号資産データのバックテストで既存戦略と比較してフレームワークを評価する。
提案手法
- 同一独立評価者のアンサンブル(EIIE)トポロジーを提案し、資産評価のソフトマックスを介してポートフォリオウェイトを生成する。
- 取引コスト意識のため過去期間のウェイトを格納するポートフォリオベクタメモリ(PVM)を導入する。
- EIIEを前取引およびオンライン設定の両方で訓練するオンライン確率的バッチ学習(OSBL)を使用する。
- 勾配上昇をガイドする明示的報酬として周期的対数リターンの平均を定義する。
- EIIEのコアとして3つのモデル変種を実験する:CNN、基本的なRNN、LSTM。
- 12資産ポートフォリオ(現金を含む11資産のトップボリュームを事前選択)と、終値・高値・安値を含む価格テンソルX_tを介して入力を正規化する。
- 欠損データはNANを平坦な価格変動で補完し、資産アイデンティティのリークを回避し一般化を保つ。
実験結果
リサーチクエスチョン
- RQ1モデルフリーの深層RLフレームワークとEIIEトポロジーは、マルチ資産設定で従来のポートフォリオ戦略を上回ることができるか。
- RQ2取引 remainder ファクター mu_t による取引コストの組み込みは学習と性能にどう影響するか。
- RQ3連続的なアクションポリシー(評価者出力のソフトマックスを介した)は、ポートフォリオ管理における離散的なアクションより有利か。
- RQ4仮想の高変動性で開放的な連続市場(例:暗号資産)に適用した場合、フレームワークは頑健か。
主な発見
- EIIEsは全3つのバックテスト実験で上位3位を独占し、他の戦略を上回る。
- バックテストの取引期間を30分とした場合、0.25%のコミッションにもかかわらず50日で少なくとも4倍のリターンを達成。
- 3つのネットワーク変種(CNN、基本的RNN、LSTM)が評価され、すべて競争力があり、アンサンブルフレームワークが優れた性能を提供。
- フレームワークは、資産を事前選択し取引コストモデルを明示的に組み込んだ暗号資産取引所(Poloniex)上で評価され、提案されたRL設定の下で強い収益性を示す。
- 報酬関数は明示的で、周期的対数リターンの平均に基づき、EIIEが時間とともに富を最大化するよう導く。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。