Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Market Making in a Multi-agent Dealer Market

Sumitra Ganesh, Nelson Vadori|arXiv (Cornell University)|Nov 14, 2019
Auction Theory and Applications参考文献 16被引用数 19
ひとこと要約

本稿では、ディーラーマーケット環境における市場メイカーのシミュレーションおよびトレーニングのためのマルチエージェント強化学習(RL)フレームワークを提案する。カスタムシミュレータを用いて、RLエージェントは提示価格の動的調整、在庫に基づく価格スプライシング、市場価格のドリフトに応じたポジションサイズの動的調整を学習し、競争的かつリスク感受性の高い状況においても頑健なパフォーマンスを達成する。

ABSTRACT

Market makers play an important role in providing liquidity to markets by continuously quoting prices at which they are willing to buy and sell, and managing inventory risk. In this paper, we build a multi-agent simulation of a dealer market and demonstrate that it can be used to understand the behavior of a reinforcement learning (RL) based market maker agent. We use the simulator to train an RL-based market maker agent with different competitive scenarios, reward formulations and market price trends (drifts). We show that the reinforcement learning agent is able to learn about its competitor's pricing policy; it also learns to manage inventory by smartly selecting asymmetric prices on the buy and sell sides (skewing), and maintaining a positive (or negative) inventory depending on whether the market price drift is positive (or negative). Finally, we propose and test reward formulations for creating risk averse RL-based market maker agents.

研究の動機と目的

  • ディーラーマーケット(店頭取引)市場における強化学習ベースの市場メイキングの研究のための現実的でマルチエージェントのシミュレーション環境を構築すること。
  • 部分観測下における競合価格戦略と在庫管理の学習プロセスを調査すること。
  • 強化学習ベースの市場メイカーにおけるリスク回避性と在庫管理に与える報酬設計の影響を評価すること。
  • 市場価格ドリフトがRLエージェントの最適在庫ポジショニングおよびスプライシング行動に与える影響を理解すること。
  • より安定的でリスク回避的な市場メイキングポリシーを生み出すために、リスクペナルティ関数を設計・テストすること。

提案手法

  • 直接取引データのみが観測可能な、相互作用する市場メイカーと投資家エージェントからなるマルチエージェントシステムとして、ディーラーマーケットを形式化する。
  • RLエージェントの現実的で競合可能な相手として、平均・分散最適化に基づく適応的市場メイカーを実装する。
  • 在庫、ミッドプライス、注文フローを含む状態表現を用いて、深層Qネットワーク(DQN)を用いてRLエージェントをトレーニングする。
  • リスク回避行動を促進するため、在庫リスクペナルティ(例:2次関数および指数関数的ペナルティ)を含む報酬関数を設計する。
  • 恒常的、ランダム、適応的など、異なる価格戦略をとる競合の種類を想定した、さまざまな競争的シナリオをシミュレートする。
  • 長期的行動と収束性を調査するため、1ロールアウトあたり200ステップの時間離散化環境を用いる。

実験結果

リサーチクエスチョン

  • RQ1RLベースの市場メイカーは、取引の部分的観測(自らの取引と執行結果のみ)から、競合する適応的市場メイカーの価格戦略を学習できるか?
  • RQ2在庫水準と市場ドリフトに応じて、RLエージェントはどのようにBid-Askスプレッドと価格スプライシングを調整するか?
  • RQ3リスクペナルティによる報酬形状の調整が、在庫のボラティリティをどれほど低減させ、ポジションサイズを安定化できるか?
  • RQ4市場価格ドリフトは、RLエージェントの最適在庫ポジションにどのように影響を与えるか?
  • RQ5正のドリフトまたは負のドリフトを活用するために、RLエージェントは方向性のある在庫ポジションを維持することで学習できるか?

主な発見

  • RLエージェントは、自らの取引と執行結果の部分的観測のみから、競合する適応的市場メイカーの価格戦略を効果的に推定する能力を習得した。
  • 明示的なバイアスや事前の指示なしに、在庫が負のときにはBidスプレッドを低下させ、在庫が正のときにはSellスプレッドを低下させる、自律的な価格スプライシング行動を発展させた。
  • 正のドリフト(μ = 1)下では、RLエージェントは平均16.06の大きな正の在庫を構築するのに対し、負のドリフト(μ = -1)下では平均-16.06の負の在庫を保有するなど、市場トレンドに動的に適応する能力を示した。
  • 報酬信号にリスクペナルティ関数を組み込むことで、在庫の標準偏差と在庫PnLの標準偏差が低下し、絶対値の平均在庫が減少した。これは、リスク回避設計の有効性を裏付けた。
  • 複数回のトレーニングランにおいて、RLエージェントはポリシー学習に収束し、恒常的および適応的両方の競合に対して安定したパフォーマンスを示した。
  • エージェントのパフォーマンスは、さまざまな市場状況においても頑健であり、ドリフトの程度や競合の行動の変動に対しても一般化能力が高いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。