[論文レビュー] Double Deep Q-Learning for Optimal Execution
本稿では、注文書の特徴、取引シグナル、アクション空間からQ値を推定する全結合ニューラルネットワークを用いて、最適な取引実行を実現するダブルディープQラーニング(DDQN)フレームワークを提案する。この手法は9種の株式のうち7種でTWAPベンチマークを上回り、中央値および平均の超過収益率が高く、利益損失レシオが向上し、複数の銘柄では95%を超える確率でTWAPを上回る。
Optimal trade execution is an important problem faced by essentially all traders. Much research into optimal execution uses stringent model assumptions and applies continuous time stochastic control to solve them. Here, we instead take a model free approach and develop a variation of Deep Q-Learning to estimate the optimal actions of a trader. The model is a fully connected Neural Network trained using Experience Replay and Double DQN with input features given by the current state of the limit order book, other trading signals, and available execution actions, while the output is the Q-value function estimating the future rewards under an arbitrary action. We apply our model to nine different stocks and find that it outperforms the standard benchmark approach on most stocks using the measures of (i) mean and median out-performance, (ii) probability of out-performance, and (iii) gain-loss ratios.
研究の動機と目的
- パrametricな仮定に依存しないモデルフリーの強化学習手法を用いて、最適な執行を実現すること。
- 連続的な状態空間およびアクション空間を有する注文書の特性を扱うために、Double DQNおよび経験再生を用いたディープQラーニングを適応すること。
- 複数の株式において実市場データを用いて、標準的なTWAPベンチマークと比較して性能を評価すること。
- 状態表現に二次変動(QV)をボラティリティの代理指標として含めることの影響を評価すること。
- 異なる市場環境や株式特性に一般化可能な金融的に解釈可能なポリシーを提供すること。
提案手法
- 全結合ディープニューラルネットワークを用いて、状態-アクションペアから期待累積報酬へのQ値関数を推定する。
- 状態表現には、時間、保有株式数、中央価格、Bid-Askスプレッド、および二次変動(QV)を特徴量として含める。
- Q値推定における過剰評価バイアスを低減し、学習の安定性を向上させるために、ダブルDQNが用いられる。
- トレーニング中の時間的相関を解消し、データ効率を向上させるために、経験再生が採用される。
- アクション空間は離散的な執行サイズから構成され、エージェントは各ステップで推定Q値を最大化するアクションを選択する。
- ネットワークは、(状態, アクション, 報酬, 次の状態)の遷移を格納するリプレイバッファを用いて訓練され、安定性を高めるためにターゲットネットワークの更新が行われる。
実験結果
リサーチクエスチョン
- RQ1パラメトリックな価格モデルに依存せずに、ディープ強化学習アプローチが標準的なTWAPベンチマークを上回ることができるか?
- RQ2状態表現に二次変動(QV)をボラティリティ特徴量として含めることで、学習された取引ポリシーおよびパフォーマンスにどのような影響を与えるか?
- RQ3DDQNモデルは、流動性やボラティリティが異なるさまざまな株式にどの程度一般化可能か?
- RQ4学習されたポリシーは、保有株式数が増加するか、残り時間の期限が短くなると執行速度を上昇させるといった、既知の経済的直感をどの程度反映しているか?
- RQ5状態表現(例:時間、価格、保有株式数、QV)の違いが、戦略のロバスト性および超過収益に与える影響は何か?
主な発見
- DDQNベースの戦略は、テストした9銘柄のうち7銘柄でTWAPを上回り、中央値および平均の相対P&Lにおいて統計的に有意な超過収益を示した。
- INTCでは、中央値の超過収益が11.63ベーシスポイント(TIP)および11.96ベーシスポイント(TIPQV)に達し、それぞれ95.8%および97.8%の確率でTWAPを上回った。
- VODでは、中央値の超過収益が14.68ベーシスポイント(TIP)および15.72ベーシスポイント(TIPQV)に達し、それぞれ97.8%および99.2%の確率でTWAPを上回った。
- QVを特徴量として含めることでパフォーマンスが一般に向上し、特に高ボラティリティ環境下で中央値の超過収益および利益損失レシオが向上した。
- 戦略は経済的に直感的な行動を示した:時間の経過、価格、ボラティリティ(QV)が上昇するにつれて執行が増加し、残存保有株式数が増加するにつれて減少した。
- アマゾンおよびグーグルを除くすべての銘柄でTWAPに対する有意な改善が見られたが、アマゾンとグーグルではパフォーマンス指標が0付近またはそれ未満にとどまり、流動性が低いかノイズが高い環境では恩恵が限定的であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。