[論文レビュー] Adversarial Deep Reinforcement Learning in Portfolio Management
この論文は中国株データを用いたポートフォリオ管理においてDDPG、PPO、PGを比較し、訓練の効率と性能を向上させるための敵対的訓練を導入し、Policy Gradient (PG) がしばしば他を上回ることを示す。敵対的強化の効果も示す。
In this paper, we implement three state-of-art continuous reinforcement learning algorithms, Deep Deterministic Policy Gradient (DDPG), Proximal Policy Optimization (PPO) and Policy Gradient (PG)in portfolio management. All of them are widely-used in game playing and robot control. What's more, PPO has appealing theoretical propeties which is hopefully potential in portfolio management. We present the performances of them under different settings, including different learning rates, objective functions, feature combinations, in order to provide insights for parameters tuning, features selection and data preparation. We also conduct intensive experiments in China Stock market and show that PG is more desirable in financial market than DDPG and PPO, although both of them are more advanced. What's more, we propose a so called Adversarial Training method and show that it can greatly improve the training efficiency and significantly promote average daily return and sharpe ratio in back test. Based on this new modification, our experiments results show that our agent based on Policy Gradient can outperform UCRP.
研究の動機と目的
- 取引コストと有限ホライゾンの下でのポートフォリオ管理に深層強化学習を適用する動機づけ。
- さまざまなハイパーパラメータ、データ前処理、特徴量セットの下で3つの連続強化学習アルゴリズム(DDPG、PPO、PG)を体系的に評価する。
- 金融環境における訓練効率とリスク感度を改善するための敵対的訓練を提案する。
- データ正規化、ネットワーク構造、特徴量の組み合わせがポリシー性能に与える影響を探る。
提案手法
- 取引コストと対数wealth報酬を用いたマルコフ決定過程としてポートフォリオ管理をモデル化する。
- ニューラルネットワーク近似器を用いてDDPG、PPO、Policy Gradientを実装・比較する。
- 市場価格にノイズを加え、ポリシーグラデーションを対応させることで敵対的訓練を導入する。
- Identical Independent Evaluators (IIE) ネットワークアーキテクチャを用いて共有パラメータで複数資産を処理する。
- 中国株市場データを用い、ポートフォリオあたり5資産、期間を跨ぐデータ正規化を実施する。
- 学習率、特徴量の組み合わせ、リスク調整目的の考慮を評価する。
実験結果
リサーチクエスチョン
- RQ1取引コストの下で中国株式ポートフォリオにおいて、どの連続強化学習アルゴリズム(DDPG、PPO、PG)が最も良いパフォーマンスを示すか。
- RQ2ハイパーパラメータ(学習率、ネットワークの深さ)、特徴選択、データ前処理がこれらのアルゴリズムのポリシー性能にどう影響するか。
- RQ3敵対的訓練はバックテストにおける訓練効率と金融パフォーマンス(例:日平均リターン、シャープレシオ)を改善するか。
- RQ4Identical Independent Evaluatorsアーキテクチャと特徴量の組み合わせがスケーラビリティと学習安定性に与える影響は何か。
- RQ5これらの強化学習アプローチは現実的な市場の摩擦の下で伝統的ベンチマークを上回ることができるか。
主な発見
- Policy Gradient (PG) は分析対象の金融市場においてDDPGおよびPPOより望ましい傾向がある。
- 敵対的訓練は訓練効率を大幅に向上させ、バックテストで日次リターンとシャープレシオを増加させる。
- 特徴量の選択が重要で、終値と高値を組み合わせると実験でより良い性能が得られる。
- 学習率はクリティック損失と安定性に影響を与え、アクター学習率は訓練ダイナミクスとクリティックの一般化に影響を与える。
- データ正規化とIIEネットワーク構造は複数資産に対するスケーラブルな学習を支援する。
- 敵対的修正を含むPGは本研究の設定の下でUCRPなどのベンチマークを上回る可能性がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。