[論文レビュー] Profitable Strategy Design by Using Deep Reinforcement Learning for Trades on Cryptocurrency Markets
本論文では、PPO、SAC、GAILを用いた深層強化学習フレームワークを提案し、利益を上げる暗号通貨取引戦略の設計を実現する。本モデルは、カスタムGym環境内で価格データおよびテクニカルインジケータデータに基づき訓練され、未観測の66日間のテスト期間において48.5%のリターン(10,000米ドルの初期投資に対して4,850米ドルの利益)を達成した。環境設計に統合された可変リスク調整ハイパーパrameterにより、トレーニング中のエージェントのリスク露出を制御可能である。
Deep Reinforcement Learning solutions have been applied to different control problems with outperforming and promising results. In this research work we have applied Proximal Policy Optimization, Soft Actor-Critic and Generative Adversarial Imitation Learning to strategy design problem of three cryptocurrency markets. Our input data includes price data and technical indicators. We have implemented a Gym environment based on cryptocurrency markets to be used with the algorithms. Our test results on unseen data shows a great potential for this approach in helping investors with an expert system to exploit the market and gain profit. Our highest gain for an unseen 66 day span is 4850 US dollars per 10000 US dollars investment. We also discuss on how a specific hyperparameter in the environment design can be used to adjust risk in the generated strategies.
研究の動機と目的
- 暗号通貨市場における深層強化学習を用いたエキスパート取引システムの開発を目的とする。
- PPO、SAC、GAILといった複数の深層強化学習アルゴリズムが、実世界の暗号通貨価格データ上でどのように性能を発揮するかを評価することを目的とする。
- 可変リスクパrameterを備えたカスタムGymベースの強化学習環境を設計し、暗号通貨取引に特化した環境を構築することを目的とする。
- トレーニング中に観測されていない市場条件においても、利益を上げる汎用性のある取引戦略を生成できるかを実証することを目的とする。
提案手法
- 価格データおよびテクニカルインジケータを含む状態空間を備えたカスタムGym環境を実装し、暗号通貨取引をシミュレートした。
- プロキシマルポリシー最適化(PPO)、ソフトアクタクリティカル(SAC)、生成的対抗的模倣学習(GAIL)を用いて、最適な取引ポリシーを学習した。
- 状態空間には、過去の価格およびRSIやMACDなどのテクニカルインジケータが含まれ、取引意思決定の根拠とした。
- 行動空間は、各タイムステップで「買い」「売り」「ホールド」の選択を可能とし、報酬はポートフォリオリターンに基づいて定義された。
- トレーニング中にエージェントのリスク露出を調整できるように、環境設計にリスク調整ハイパーパrameterを導入した。
- モデルは履歴データでトレーニングされ、別個の未観測66日間のテスト期間で評価され、汎化性能および利益性の評価が行われた。
実験結果
リサーチクエスチョン
- RQ1PPO、SAC、GAILは、価格データおよびテクニカルインジケータデータのみを用いて、暗号通貨市場で利益を上げる取引戦略を学習できるか?
- RQ2PPO、SAC、GAILは、暗号通貨取引戦略生成に応用された際、性能および安定性においてどのように比較されるか?
- RQ3環境設計に統合された可変ハイパーパrameterが、生成された取引戦略のリスクプロファイルを効果的に制御できるか?
- RQ4トレーニング中に観測されていない市場状況において、訓練済みエージェントはどの程度一般化性能を示せるか?
- RQ5実世界の暗号通貨データを用いたテスト期間において、深層強化学習ベースの戦略でどの程度の利益が達成可能か?
主な発見
- 最も優れたエージェントは、未観測の66日間のテスト期間で48.5%のリターンを達成し、10,000米ドルの初期投資に対して4,850米ドルの利益を上げた。
- PPO、SAC、GAILの3つのアルゴリズムすべてが、暗号通貨データ上で利益を上げるポリシーを学習できることを示した。
- 環境設計に統合された可変リスクハイパーパrameterのおかげで、生成された戦略のリスク露出を体系的に調整可能となった。
- モデルは強力な汎化性能を示し、トレーニング中に観測されていないデータでも利益を維持した。
- 結果から、深層強化学習は暗号通貨市場におけるエキスパート取引システムの構築に実用的である可能性があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。