Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement-Learning based Portfolio Management with Augmented Asset Movement Prediction States

Yunan Ye, Hengzhi Pei|arXiv (Cornell University)|Feb 9, 2020
Blockchain Technology Applications and Security参考文献 8被引用数 4
ひとこと要約

本稿では、資産価格や金融ニュースなどの異種データを統合し、予測された価格動向を追加状態として組み込むことで、ポートフォリオ管理のための状態拡張強化学習フレームワークSARLを提案する。この手法は、ビットコインおよびハイテク株式データセットにおいて、最先端手法と比較して累積リターンが140.9–15.7%向上し、シャープ比も最大40.45%改善されるなど、ポートフォリオのパフォーマンスとリスク調整リターンを顕著に向上させる。

ABSTRACT

Portfolio management (PM) is a fundamental financial planning task that aims to achieve investment goals such as maximal profits or minimal risks. Its decision process involves continuous derivation of valuable information from various data sources and sequential decision optimization, which is a prospective research direction for reinforcement learning (RL). In this paper, we propose SARL, a novel State-Augmented RL framework for PM. Our framework aims to address two unique challenges in financial PM: (1) data heterogeneity -- the collected information for each asset is usually diverse, noisy and imbalanced (e.g., news articles); and (2) environment uncertainty -- the financial market is versatile and non-stationary. To incorporate heterogeneous data and enhance robustness against environment uncertainty, our SARL augments the asset information with their price movement prediction as additional states, where the prediction can be solely based on financial data (e.g., asset prices) or derived from alternative sources such as news. Experiments on two real-world datasets, (i) Bitcoin market and (ii) HighTech stock market with 7-year Reuters news articles, validate the effectiveness of SARL over existing PM approaches, both in terms of accumulated profits and risk-adjusted profits. Moreover, extensive simulations are conducted to demonstrate the importance of our proposed state augmentation, providing new insights and boosting performance significantly over standard RL-based PM method and other baselines.

研究の動機と目的

  • 構造化された価格データと非構造化されたニュース記事の間で多様でノイジーかつ不均衡な資産情報が存在するファイナンス市場におけるデータの異種性に対処する。
  • 非定常な金融市場やトレーニングデータとテストデータの間で分布シフトが生じる環境の不確実性を軽減する。
  • 予測信号を用いた状態拡張により、強化学習に基づくポートフォリオ戦略の一般化性とロバスト性を向上させる。
  • 予測信号が有用である場合、外部のノイジーまたはスパarsな情報でさえも、ポートフォリオパフォーマンスを向上させられることを示す。
  • SARLが標準的なRLおよび既存のPMベースラインと比較して、累積リターンおよびシャープ比を含むリスク調整指標において優れた性能を示すことを検証する。

提案手法

  • 元の強化学習状態空間に予測された資産価格動向を追加状態として組み込むことで、一般化された状態拡張強化学習(SARL)フレームワークを提案する。
  • 歴史的資産価格やニュース記事といった複数のデータソースを用いて価格動向予測を生成し、それを拡張状態として統合する。
  • 金融ニュースをベクトル表現に変換して状態空間に統合するために、事前学習済み自然言語モデル(例:BERTベースの埋め込み)を活用する。
  • 標準的な強化学習アルゴリズム(例:PPO、DPG、PG)を用いて拡張状態空間上でエージェントを訓練し、最適なポートフォリオ割り当て方策を学習する。
  • 予測精度やラベルスパarsityの変動を模擬することで、不確実性下でのロバストネスと一般化性能を評価する。
  • 実世界のデータセット上で、DPM(ポートフォリオ管理のためのディープQネットワーク)や伝統的なPM戦略(CRP、OLMAR、WMAMR)といったベースライン手法とSARLを比較する。

実験結果

リサーチクエスチョン

  • RQ1金融ニュースのような異種データソースを強化学習の状態空間に統合することで、ポートフォリオ管理のパフォーマンスが向上するか?
  • RQ2外部の価格動向予測の正確さとスパarsityが、強化学習ベースのポートフォリオエージェントのパフォーマンスにどのように影響するか?
  • RQ3分布シフトや市場の不確実性下でも、SARLは標準的なRLベースのPM手法よりも一般化性が優れているか?
  • RQ4埋め込みられた拡張状態としてのノイジーまたは低頻度の外部信号が、どれほどポートフォリオリターンの向上に寄与できるか?
  • RQ5金融ニュースに隠された意味的相関が、拡張状態表現の予測力向上に果たす役割は何か?

主な発見

  • ビットコインデータセットにおいて、SARLは最先端手法と比較して累積リターンで140.9%の向上を達成し、顕著なパフォーマンス向上を示した。
  • ハイテク株式データセットでは、SARLはすべてのベースラインを累積リターンで15.7%上回り、シャープ比も40.45%高い水準を達成した。
  • 60%の正確さを持つがランダムにシミュレートされた予測ラベルでさえも、DPMを上回るパフォーマンスを示しており、ノイズの多い外部信号に対してもロバストであることが示された。
  • 予測信号のラベル密度が高くなる(例:80–100%)ほど、ポートフォリオパフォーマンスが向上し、50%の密度と70%の正確さの条件下でDPMと比較してポートフォリオ価値が90.3%増加した。
  • ランダムにシミュレートされたラベルで訓練されたモデルと比較して、SARLは顕著に優れたパフォーマンスを示しており、ランダムな信号に存在しない、実際の金融ニュースに埋め込まれた利用可能な隠れ相関があることが示された。
  • SARLのシャープ比は、時間経過にわたりDPMを常に上回り、損失関数に明示的なリスク正則化を組み込まずとも、リスクを意識した戦略を学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。