Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Trading Strategies in Quantitative Markets using Multi-Agent Reinforcement Learning

Hengxi Zhang, Zhendong Shi|arXiv (Cornell University)|Mar 15, 2023
Financial Markets and Investment StrategiesEconomics, Econometrics and Finance被引用数 3
ひとこと要約

本稿では、多エージェント強化学習フレームワークとして、定率ポートフォリオインシュランス(CPPI)および時間不変ポートフォリオ保護(TIPP)戦略を多エージェント深層決定的方策勾配(MADDPG)アルゴリズムと統合した新規手法、CPPI-MADDPGおよびTIPP-MADDPGを提案する。深セン証券取引所の100種類の実株式において評価された結果、両手法とも従来の戦略およびベースライン強化学習モデルを上回り、TIPP-MADDPGは最高の年間リターン(9.68%)を達成し、CPPI-MADDPGは最高のシャープレシオ(2.18)を記録した。

ABSTRACT

Quantitative markets are characterized by swift dynamics and abundant uncertainties, making the pursuit of profit-driven stock trading actions inherently challenging. Within this context, reinforcement learning (RL), which operates on a reward-centric mechanism for optimal control, has surfaced as a potentially effective solution to the intricate financial decision-making conundrums presented. This paper delves into the fusion of two established financial trading strategies, namely the constant proportion portfolio insurance (CPPI) and the time-invariant portfolio protection (TIPP), with the multi-agent deep deterministic policy gradient (MADDPG) framework. As a result, we introduce two novel multi-agent RL (MARL) methods, CPPI-MADDPG and TIPP-MADDPG, tailored for probing strategic trading within quantitative markets. To validate these innovations, we implemented them on a diverse selection of 100 real-market shares. Our empirical findings reveal that the CPPI-MADDPG and TIPP-MADDPG strategies consistently outpace their traditional counterparts, affirming their efficacy in the realm of quantitative trading.

研究の動機と目的

  • 人間トレーダーが非合理的な意思決定をしやすい高頻度で不確実性が高く動的な定量的トレーディング環境における課題に対処すること。
  • 確立された金融リスク管理戦略(CPPIおよびTIPP)を多エージェント強化学習フレームワークに統合することで、変動が激しい市場におけるポートフォリオ管理を改善すること。
  • ルールベースのポートフォリオ保護メカニズムとMARLを融合させた場合、標準的なRLおよび従来のポートフォリオ手法と比較して、より優れたリスク調整リターンが得られるかどうかを評価すること。
  • 深セン証券取引所の100銘柄を用いた実市場条件下での実証的バックテストを通じて、CPPI-MADDPGおよびTIPP-MADDPGの有効性を実証すること。

提案手法

  • フレームワークは、N体のエージェントを含む確率的ゲームとして戦略的トレーディングをモデル化し、各エージェントは株価、保有株式数、現金残高を表す共有状態ベクトル s = [p, h, b] を観測する。
  • 各エージェントは、観測に基づいて行動(ポートフォリオウェイト)を選択する方策ネットワーク πθi を使用するが、行動はCPPIまたはTIPPに基づくルールベースのインシュランス論理に従うように制約される。
  • MADDPGアルゴリズムは、共同行動と状態を観測できる集中型クライアントを導入することで変更され、信用割り当てとより良い共同方策学習が可能になる。
  • リプレイバッファは遷移 ⟨s, a, r, s′⟩ を格納し、トレーニングの安定化のため、τ = 0.01 を用いたソフト更新ルールでターゲットネットワークが更新される。
  • 行動選択プロセスにはノイズプロセス 𝒩 を用いた探索が含まれ、行動がルールベース方策 Φ(s) の範囲外にある場合は、CPPI/TIPPの制約を満たすようにクリッピングまたは調整が行われる。
  • クライアントは式 (4) の損失を最小化するように学習され、エージェントは式 (3) の方策勾配を用いて更新され、両者とも二重Qターゲット推定アプローチが用いられる。

実験結果

リサーチクエスチョン

  • RQ1CPPIおよびTIPPのリスク管理メカニズムを多エージェントディープ強化学習と統合することで、定量的トレーディング環境におけるポートフォリオパフォーマンスが向上するか?
  • RQ2CPPI-MADDPGおよびTIPP-MADDPGは、ベースラインRL手法(例:MADDPG、MADQN)および従来の戦略(例:ユニバーサルポートフォリオ)と比較して、リスク調整リターンの観点で優れているか?
  • RQ3ルールベースのポートフォリオインシュランスの導入により、制約なしのRLエージェントと比較して、安定性が向上し、ドローダウンが低減するか?
  • RQ4CPPI(ギャップリスク)とTIPP(時間ベースのフロア)の異なるリスクプロファイルが、ハイブリッドMARLモデルのパフォーマンスにどのように影響するか?
  • RQ5パrameterチューニングにより、ハイブリッドモデルが投資家のリスク嗜好に適応できる程度はどの程度か?

主な発見

  • TIPP-MADDPGは9.68%の最高年間リターンを達成し、ユニバーサルポートフォリオ(3.36%)およびMADDPG(8.22%)を顕著に上回った。
  • CPPI-MADDPGは2.18の最高シャープレシオを記録し、TIPP-MADDPG(2.09)およびMADDPG(1.99)と比較して、より優れたリスク調整パフォーマンスを示した。
  • CPPI-MADDPGは6.60%の最低最大ドローダウンを記録し、TIPP-MADDPG(9.02%)およびMADDPG(12.26%)と比較して、より強い下落保護を示した。
  • TIPP-MADDPG戦略は、取引日80〜160日の間に急激なパフォーマンス上昇を示し、市場トレンドへの感受性が高いことを示した。
  • MADDPGベースのエージェントは均一な資産配分を示したが、CPPI-MADDPGおよびTIPP-MADDPGエージェントは、よりスパarsな、ルールに基づく配分を採用しており、戦略的リスク管理の反映が見られた。
  • 特定のパrameter設定下では、ハイブリッドモデルがベースラインMADDPGのパフォーマンスに回復したため、リスク嗜好のチューニングに柔軟かつ制御可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。