[論文レビュー] Cost-Sensitive Portfolio Selection via Deep Reinforcement Learning
本稿では、価格パターンと資産相関を捉えるために二重ストリームニューラルネットワークを用い、取引コストとリスクコストを制約しつつリターンを最適化する新たなコスト感受性報酬関数を組み合わせた、コスト感受性のポートフォリオ選択のための深層強化学習フレームワークを提案する。実世界の暗号資産および株式データセットにおいて、優れた収益性とコスト感受性を達成しており、理論的分析により近似的に最適な成長率を達成している。
Portfolio Selection is an important real-world financial task and has attracted extensive attention in artificial intelligence communities. This task, however, has two main difficulties: (i) the non-stationary price series and complex asset correlations make the learning of feature representation very hard; (ii) the practicality principle in financial markets requires controlling both transaction and risk costs. Most existing methods adopt handcraft features and/or consider no constraints for the costs, which may make them perform unsatisfactorily and fail to control both costs in practice. In this paper, we propose a cost-sensitive portfolio selection method with deep reinforcement learning. Specifically, a novel two-stream portfolio policy network is devised to extract both price series patterns and asset correlations, while a new cost-sensitive reward function is developed to maximize the accumulated return and constrain both costs via reinforcement learning. We theoretically analyze the near-optimality of the proposed reward, which shows that the growth rate of the policy regarding this reward function can approach the theoretical optimum. We also empirically evaluate the proposed method on real-world datasets. Promising results demonstrate the effectiveness and superiority of the proposed method in terms of profitability, cost-sensitivity and representation abilities.
研究の動機と目的
- 既存の手法が手作業で特徴を設計していることに起因する非ステーションナリティな価格系列と複雑な資産相関の問題に対処すること。
- 先行研究でしばしば無視されたり別々に扱われたりする取引コストとリスクコストを、同時に制御すること。
- 有効な表現と最適な取引ポリシーをエンドツーエンドで学習する強化学習ベースのフレームワークを開発すること。
- 提案された報酬関数が資産成長率を最大化する上で近似的に最適であることを理論的に正当化すること。
- 実金融データセットを用いた実験的検証を通じて、収益性、コスト感受性、表現学習の面で本手法の優位性を検証すること。
提案手法
- 二重ストリームニューラルネットワークアーキテクチャを提案:一方のストリームは1次元畳み込みニューラルネットワーク(1D-CNN)を用いて時系列価格データを処理し、時間的パターンを抽出する。もう一方のストリームはグラフ畳み込みネットワーク(GCN)を用いて資産相関行列を処理し、資産間の依存関係をモデル化する。
- 二つのストリームを統合し、市場状態の統合表現を生成し、その表現をポリシーネットワークが使用してポートフォリオウェイトを出力する。
- 累積リターンを最大化するとともに、取引コスト(トレードオーバーに基づく)とリスク(ボラティリティに基づく)をペナルティとして課す、新たなコスト感受性報酬関数を設計。実用的パフォーマンスの直接最適化を可能にする。
- ポリシーは、訓練の安定性を向上させるために、ダウエルドQネットワークを用いたDDPGを含むアクター・クリティック強化学習アルゴリズムで訓練される。
- 本手法は、状態が歴史的価格系列と相関構造によって定義されるマルコフ意思決定過程(MDP)として定式化される。
- 理論的分析により、提案された報酬関数下でのポリシーの成長率が理論的最適値に近づくことが証明され、近似的に最適性が保証されている。
実験結果
リサーチクエスチョン
- RQ1深層強化学習フレームワークは、ポートフォリオ選択において非ステーションナリティな価格系列と資産相関の意味のある表現を効果的に学習できるか?
- RQ21つの報酬関数が、動的ポートフォリオ管理においてリターン、取引コスト、リスク露出を同時に最適化できるか?
- RQ3提案された二重ストリームアーキテクチャは、手作業特徴や単一ストリーム表現を用いたモデルに比べ、収益性とコスト制御の面で優れているか?
- RQ4学習されたポリシーのパフォーマンスは、コスト制約下での理論的最適成長率にどれほど近いか?
- RQ5本手法は、暗号資産や株式市場など、異なる金融市場に一般化可能か?
主な発見
- Crypto-Aデータセットでは、提案されたPPN手法が年間平均ポートフォリオ価値(APV)32.04%を達成し、PPN-AC(11.72%)や他のベースラインを著しく上回った。
- Crypto-Aでは、最大下落率(MMD)を38.86%まで低下させたのに対し、PPN-ACは60.25%であった。リスクコントロールの優位性が示された。
- S&P500データセットでは、APVが32.04%、標準偏差が2.16%を記録し、20回の異なるランダムシードにおいても収益性と安定性が確認された。
- PPN-ACと比較して取引コストを79.87%削減した。コスト感受性報酬関数の有効性が裏付けられた。
- 二重ストリームアーキテクチャはシャープレシオ6.85%を達成し、単一ストリームモデルを上回り、価格パターンと相関の共同学習の重要性が浮き彫りになった。
- 理論的分析により、提案された報酬関数下でのポリシーの成長率が理論的最適値に近づくことが確認され、近似的に最適性の妥当性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。