Skip to main content
QUICK REVIEW

[論文レビュー] A Modularized and Scalable Multi-Agent Reinforcement Learning-based System for Financial Portfolio Management.

Zhenhan Huang, Fumihide Tanaka|arXiv (Cornell University)|Feb 6, 2021
Stock Market Forecasting Methods参考文献 13被引用数 4
ひとこと要約

本稿では、資産固有のシグナル生成のための非同期更新型の進化型エージェントモジュール(EAMs)と、ポートフォリオ再バランスのための戦略的エージェントモジュール(SAMs)を備えた、モジュラーでスケーラブルなマルチエージェント強化学習システムであるMSPMを提案する。MSPMは米国株式市場の8年間のデータにおいて、スケーラブルで再利用可能かつ情報豊富なアーキテクチャに加え、新規銘柄への転移学習を組み合わせることで、優れた利益蓄積を実現し、ベンチマークを上回る性能を示した。

ABSTRACT

Financial Portfolio Management is one of the most applicable problems in Reinforcement Learning (RL) by its sequential decision-making nature. Existing RL-based approaches, while inspiring, often lack scalability, reusability, or profundity of intake information to accommodate the ever-changing capital markets. In this paper, we design and develop MSPM, a novel Multi-agent Reinforcement learning-based system with a modularized and scalable architecture for portfolio management. MSPM involves two asynchronously updated units: Evolving Agent Module (EAM) and Strategic Agent Module (SAM). A self-sustained EAM produces signal-comprised information for a specific asset using heterogeneous data inputs, and each EAM possesses its reusability to have connections to multiple SAMs. A SAM is responsible for the assets reallocation of a portfolio using profound information from the EAMs connected. With the elaborate architecture and the multi-step condensation of the volatile market information, MSPM aims to provide a customizable, stable, and dedicated solution to portfolio management that existing approaches do not. We also tackle data-shortage issue of newly-listed stocks by transfer learning, and validate the necessity of EAM. Experiments on 8-year U.S. stock markets data prove the effectiveness of MSPM in profits accumulation by its outperformance over existing benchmarks.

研究の動機と目的

  • 既存の強化学習ベースのポートフォリオ管理システムにおけるスケーラビリティおよび再利用可能性の制限を解消すること。
  • モジュラーなアーキテクチャを通じて、深く多様なデータの統合をポートフォリオ意思決定に可能にする。
  • シグナル生成と戦略的割当を分離することで、動的市場に適応可能な安定的でカスタマイズ可能なソリューションを提供すること。
  • 新規上場銘柄におけるデータ不足を転移学習によって緩和すること。
  • 進化型エージェントモジュール(EAM)がポートフォリオパフォーマンスを向上させる必要性と有効性を検証すること。

提案手法

  • EAMとSAMの2つの非同期更新型コンponentを備えたモジュラーなアーキテクチャを設計する。
  • EAMを用いて、多様なデータ入力を活用して資産固有のシグナルを生成し、複数のSAMに再利用可能であることを保証する。
  • SAMを用いて、接続されたEAMからの統合的かつ高レベルの情報を基に、ポートフォリオの再割当を実行する。
  • マルチステップの情報圧縮を適用して、市場のボラティリティが意思決定に与える影響を低減する。
  • EAMに転移学習を統合し、新規上場銘柄におけるデータ不足を緩和する。
  • スケーラブルで分離された設計を採用することで、EAMとSAMの独立したトレーニングおよびデプロイメントを可能にする。

実験結果

リサーチクエスチョン

  • RQ1モノリシックな強化学習アプローチと比較して、モジュラーでマルチエージェント強化学習アーキテクチャは、金融ポートフォリオ管理におけるスケーラビリティおよび再利用可能性をどのように向上させるか?
  • RQ2EAM-SAMの分離は、動的市場におけるパフォーマンスの安定性と情報の深さをどの程度向上させるか?
  • RQ3EAMフレームワーク内での転移学習は、新規上場銘柄におけるデータ不足の緩和にどの程度有効か?
  • RQ4提案されたシステムは、長期市場サイクルにわたる累積的利益蓄積において、既存の強化学習ベースのベンチマークを上回るか?
  • RQ5EAMモジュールは全体のポートフォリオパフォーマンスにどの程度寄与しており、その導入は必須か?

主な発見

  • MSPMは米国株式市場の8年間のデータにおいて、既存のベンチマークを上回る優れた利益蓄積を達成した。
  • モジュラー設計により、EAMは複数のSAMに再利用可能となり、システムのスケーラビリティと保守性が向上した。
  • EAMとSAM間の非同期更新メカニズムにより、トレーニングの安定性と意思決定のロバスト性が向上した。
  • 転移学習により、事前学習済みのEAMを活用することで、新規上場銘柄におけるパフォーマンスの低下が効果的に低減された。
  • アブレーションスタディにより、EAMの削除は顕著なパフォーマンス低下を引き起こすことが確認され、EAMの必要性が裏付けられた。
  • ボラティリティの高い市場シグナルのマルチステップ圧縮が、より安定的で情報に基づいたポートフォリオ配分に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。