Skip to main content
QUICK REVIEW

[論文レビュー] Robust Log-Optimal Strategy with Reinforcement Learning

Yifeng Guo, Xingyu Fu|arXiv (Cornell University)|May 1, 2018
Advanced Bandit Algorithms Research参考文献 13被引用数 5
ひとこと要約

本稿では、一般対数最適戦略(GLOS)の複雑なCDF推定を避けるために2次テイラー展開を用いて近似するロバスト対数最適戦略(RLOS)を提案する。これにより計算効率とロバスティック性が向上する。さらに、RLOSを深層強化学習(RLOSRL)と統合し、CSI300構成銘柄株式における複数のバックテストでベースライン戦略を上回る収益性と安定性を示した。

ABSTRACT

We proposed a new Portfolio Management method termed as Robust Log-Optimal Strategy (RLOS), which ameliorates the General Log-Optimal Strategy (GLOS) by approximating the traditional objective function with quadratic Taylor expansion. It avoids GLOS's complex CDF estimation process,hence resists the "Butterfly Effect" caused by estimation error. Besides,RLOS retains GLOS's profitability and the optimization problem involved in RLOS is computationally far more practical compared to GLOS. Further, we combine RLOS with Reinforcement Learning (RL) and propose the so-called Robust Log-Optimal Strategy with Reinforcement Learning (RLOSRL), where the RL agent receives the analyzed results from RLOS and observes the trading environment to make comprehensive investment decisions. The RLOSRL's performance is compared to some traditional strategies on several back tests, where we randomly choose a selection of constituent stocks of the CSI300 index as assets under management and the test results validate its profitability and stability.

研究の動機と目的

  • 一般対数最適戦略(GLOS)における複雑なCDF推定に起因する計算非可能性と推定誤差への感受性を解消する。
  • 収益性と長期的優位性を維持しつつ、計算効率が高くロバストなGLOSの代替手法を開発する。
  • RLOSを強化学習と統合し、市場フィードバックから学習する動的かつ適応的なポートフォリオマネジメントシステムを構築する。
  • 従来の戦略(フォローザウィナー、フォローザローザー、ネイティブ・アベレージ)と比較して、RLOSおよびRLOSRLのパフォーマンスと安定性を実証的に検証する。
  • 非定常的ダイナミクスを示す現実市場データへのアンサンブル戦略の適用可能性を検討する。

提案手法

  • RLOSは、最適ポートフォリオウェイトの周囲で2次テイラー展開を用いてGLOSの目的関数を近似し、直接的なCDF推定の必要性を排除する。
  • この手法は、計算複雑性と推定誤差への感受性を顕著に低減しながらも、対数最適リターン最大化というコアな目的関数を維持する。
  • RLOSRLは、市場データを処理するための畳み込みニューラルネットワーク(CNN)を備えた深層Qネットワークと、RLOSの出力を入力として受ける報酬ベースの強化学習エージェントを用いる。
  • 経験再生はポアソン分布に従うサンプリングを用い、最近の市場データに優先的に重みを置くことで、非定常的金融環境への適応性を向上させる。
  • ポリシー・ネットワークの最適化には、対数リターン最大化、下回るパフォーマンスに対するペナルティ、およびL2正則化(重み減衰)を組み合わせた損失関数を用いる。
  • 学習率の減衰、モーメンタム、正則化などのハイパーパrameterは、歴史的CSI300データを用いた実証的妥当性検証により調整された。

実験結果

リサーチクエスチョン

  • RQ1GLOS目的関数のロバストな近似は、収益性を損なわず計算複雑性と推定感受性を低減できるか?
  • RQ2RLOSを強化学習と統合することで、動的でノイズの多い金融市場におけるポートフォリオパフォーマンスはどのように向上するか?
  • RQ3RLOSRLは、フォローザウィナー、フォローザローザー、ネイティブ・アベレージといった従来戦略と比較して、資産成長と安定性の面でどの程度優れているか?
  • RQ4経験再生にポアソン分布を用いることで、非定常的金融時系列における強化学習エージェントのパフォーマンスはどの程度向上するか?
  • RQ5RLOSRLフレームワークは、他の資産クラスやハイフリクエンシートレーディング環境へ一般化可能か?

主な発見

  • RLOSは、500日、1000日、1500日分のすべてのバックテストで、ネイティブ・アベレージ、フォローザウィナー、フォローザローザーを上回った。
  • RLOSRLは、すべてのバックテストでRLOSを上回る累積資産を達成し、意思決定における強化学習の追加的価値を示した。
  • RLOSRLのパフォーマンスは長期にわたり安定的かつ収益性を維持しており、市場ダイナミクスへの強い適応性を示した。
  • 経験再生にポアソン分布を用いることで、モデルの収束性と最近の市場状態への対応性が向上した。
  • RLOSとRLの統合により意思決定の質が顕著に向上し、単体のRLOSと比較して優れた資産蓄積が実証された。
  • 直接的なCDF推定を回避することで、推定誤差へのロバスティック性が向上し、『バタフライ効果』のリスクが低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。