Skip to main content
QUICK REVIEW

[論文レビュー] Deep reinforcement learning for time series: playing idealized trading games

Xiang Gao|arXiv (Cornell University)|Mar 11, 2018
Stock Market Forecasting MethodsDecision Sciences参考文献 19被引用数 17
ひとこと要約

本論文は、深層強化学習、特にLSTM、GRU、CNN、MLPアーキテクチャを用いたDeep Q-Networksを用い、2つの理想化された時系列環境(単変量:波状の価格、および二変量:価格に加えて相関のあるノイズの多い信号)において最適な取引戦略を学習することを目的としている。単変量ゲームではGRUベースのエージェントが他のエージェントを上回り、二変量ゲームではMLPベースのエージェントが優れた性能を示し、時系列入力からの戦略学習の有効性が裏付けられた。

ABSTRACT

Deep Q-learning is investigated as an end-to-end solution to estimate the optimal strategies for acting on time series input. Experiments are conducted on two idealized trading games. 1) Univariate: the only input is a wave-like price time series, and 2) Bivariate: the input includes a random stepwise price time series and a noisy signal time series, which is positively correlated with future price changes. The Univariate game tests whether the agent can capture the underlying dynamics, and the Bivariate game tests whether the agent can utilize the hidden relation among the inputs. Stacked Gated Recurrent Unit (GRU), Long Short-Term Memory (LSTM) units, Convolutional Neural Network (CNN), and multi-layer perceptron (MLP) are used to model Q values. For both games, all agents successfully find a profitable strategy. The GRU-based agents show best overall performance in the Univariate game, while the MLP-based agents outperform others in the Bivariate game.

研究の動機と目的

  • 深層強化学習が、ドメイン特化の特徴工学を前提とせず、時系列入力から収益性の高い取引戦略を学習できるかどうかを調査すること。
  • GRU、LSTM、CNN、MLPといった異なる深層ニューラルネットワークアーキテクチャが、取引における逐次的意思決定のQ値をモデル化する上で、どの程度有効であるかを評価すること。
  • エージェントが、将来の価格変動と相関するノイズの多い信号に隠れたパターンを発見できるかどうかをテストすること。
  • 1つの環境では価格ダイナミクスのみ、もう1つの環境では情報のある信号を含む、2つの制御された環境間でモデルのパフォーマンスを比較すること。

提案手法

  • 本研究では、さまざまな再帰的および順方向アーキテクチャを用いたDeep Q-Networks(DQN)を採用し、時系列観測からQ値を推定する。
  • 単変量ゲームでは入力が波状の価格系列である。二変量ゲームでは、段階的価格系列と相関のあるノイズの多い信号が入力となる。
  • Q値関数をモデル化するために、スタックドゲート付き再帰ユニット(GRUs)、長短期記憶(LSTM)ユニット、畳み込みニューラルネットワーク(CNNs)、多層パーセプトロン(MLPs)が用いられた。
  • 強化学習フレームワークにおける学習の安定化を図るため、経験再生とターゲットネットワークが使用された。
  • トレーニングは、エージェントが時間経過に伴う累積ポートフォリオリターンに基づいて報酬を受けるシミュレーテッド環境で実施された。
  • 各エージェントのパフォーマンスは、複数回のトレーニングランにおける最終的累積リターンと一貫性に基づいて評価された。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習エージェントは、明示的な特徴工学を伴わず、生の時系列データから収益性の高い取引戦略を学習できるか?
  • RQ2GRU、LSTM、CNN、MLPといった異なるニューラルネットワークアーキテクチャは、時系列入力からの最適戦略学習において、どのように比較されるか?
  • RQ3二変量取引環境において、将来の価格変動と正の相関を持つノイズの多い信号をエージェントが活用できるか?
  • RQ4エージェントのパフォーマンスは、周期性やノイズレベルといった時系列の根本的構造に依存するか?
  • RQ5どのアーキテクチャが、さまざまな時系列ダイナミクスにおいて最も頑健で収益性の高い戦略を生み出すか?

主な発見

  • 単変量ゲームでは、GRUベースのエージェントが最高の累積リターンを達成し、周期的価格ダイナミクスをモデル化する優れた能力を示した。
  • 二変量ゲームでは、MLPベースのエージェントが他のすべてのアーキテクチャを上回り、信号とノイズの関係を効果的に捉えたと示唆された。
  • すべてのエージェントアーキテクチャが、両方のゲームで収益性のある戦略を学習した。これは、DQNフレームワークが時系列意思決定に非常に頑健であることを示している。
  • 単変量設定において、スタックドGRUとLSTMは、順方向ネットワークよりも優れた時系列モデリングを実現した。
  • 二変量ゲームにおいて、相関のあるノイズの多い信号の導入がパフォーマンスを著しく向上させた。これは、エージェントが不完全な信号から有用な情報を抽出できることを確認した。
  • 結果から、エンドツーエンドの深層強化学習が、生の時系列入力から非自明な取引戦略を直接発見できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。