Skip to main content
QUICK REVIEW

[論文レビュー] R2-B2: Recursive Reasoning-Based Bayesian Optimization for No-Regret Learning in Games

Zhongxiang Dai, Yizhou Chen|arXiv (Cornell University)|Jun 30, 2020
Machine Learning and Data Classification被引用数 15
ひとこと要約

本稿では、有界合理的で自己利益志向のエージェントが関与する繰り返しゲームにおけるレギュレートなし学習のための、再帰的推論に基づくベイズ最適化フレームワークR2-B2を提案する。エージェントの戦略的推論をレベル≥2および相手より1レベル高いレベルでモデル化することで、標準的なBOに比べてより速い漸近的収束を達成する。軽量版(R2-B2-Lite)は、敵対的MLおよびマルチエージェント強化学習の設定において強力な実験的防御を提供する。

ABSTRACT

This paper presents a recursive reasoning formalism of Bayesian optimization (BO) to model the reasoning process in the interactions between boundedly rational, self-interested agents with unknown, complex, and costly-to-evaluate payoff functions in repeated games, which we call Recursive Reasoning-Based BO (R2-B2). Our R2-B2 algorithm is general in that it does not constrain the relationship among the payoff functions of different agents and can thus be applied to various types of games such as constant-sum, general-sum, and common-payoff games. We prove that by reasoning at level 2 or more and at one level higher than the other agents, our R2-B2 agent can achieve faster asymptotic convergence to no regret than that without utilizing recursive reasoning. We also propose a computationally cheaper variant of R2-B2 called R2-B2-Lite at the expense of a weaker convergence guarantee. The performance and generality of our R2-B2 algorithm are empirically demonstrated using synthetic games, adversarial machine learning, and multi-agent reinforcement learning.

研究の動機と目的

  • 報酬関数が未知で複雑かつ評価に高コストがかかる繰り返しゲームにおける、ノーレギュレート学習の課題に対処すること。
  • 認知階層理論にインspiredされた再帰的階層を用いて、有界合理的エージェントの戦略的推論をモデル化すること。
  • 複数レベルの推論を統合したベイズ最適化フレームワークを開発し、ノーレギュレートへの収束速度を向上させること。
  • 定数和ゲーム、一般和ゲーム、共通報酬ゲームを含む、さまざまなゲームタイプに一般化すること。
  • 計算コストが低いが、依然として効果的な収束保証を持つ、R2-B2の変種(R2-B2-Lite)を提供すること。

提案手法

  • k段階の階層を用いてエージェントの再帰的推論を形式化:レベル0(確率的)、レベルk ≥ 1(レベル0からk−1までのエージェントの推論に最適応答)。
  • エージェントの行動空間における未知の報酬関数を予測するために、ガウス過程(GP)のスレーブモデルを用いたベイズ最適化を統合する。
  • 逐次ブラックボックス最適化における探索と活用のバランスをとるために、GP-UCBの獲得関数を用いる。
  • 各イテレーションで、R2-B2エージェントは、自身の推論レベルを仮定した上で相手の行動をシミュレートし、最適応答を選択する。
  • R2-B2-Liteでは、完全な再帰的シミュレーションを避けることで推論プロセスを簡素化する。
  • すべてのエージェントが全ゲーム履歴を観測できる、同時手番および完全監視の繰り返しゲームにフレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1ベイズ最適化における再帰的推論は、報酬関数が未知の繰り返しゲームにおいて、ノーレギュレートへの収束を加速できるか?
  • RQ2レベルk ≥ 2の推論と、相手より1段階高いレベルの推論は、非再帰的BO戦略に比べてより速い収束をもたらすか?
  • RQ3R2-B2は、定数和、一般和、共通報酬ゲームを含む多様なゲームタイプにおいて、どのように性能を発揮するか?
  • RQ4R2-B2-Liteは、完全なR2-B2に比べて計算コストを削減しながらも、強力な実験的性能を維持できるか?
  • RQ5R2-B2は、機械学習におけるブラックボックス攻撃に対してどの程度防御できるか?また、マルチエージェント強化学習におけるサンプル効率をどのように向上できるか?

主な発見

  • エージェントがレベルk ≥ 2および相手より1段階高いレベルで推論する場合、R2-B2は標準的なベイズ最適化に比べて、ノーレギュレートへの漸近的収束が速い。
  • R2-B2-Liteは計算コストを削減しながらも、攻撃の成功をわずか0.8および0.7に制限するなど、効果的な敵対的攻撃防御を実現した。
  • 敵対的機械学習の文脈では、レベル1のR2-B2-Liteディフェンダーが、GP-UCBおよびサンプリングベースのThompson sampling攻撃の両方を効果的に無効化した。
  • マルチエージェント強化学習の文脈では、R2-B2は55次元のパrameter空間における効率的なポリシー探索を可能にした。報酬は[0,1]にクリッピングおよびスケーリングされた結果が報告された。
  • フレームワークは、合成ゲーム、敵対的ML、MARL環境において、強力な一般性と頑健性を示した。GPハイパーパrameterは10イテレーションごとに最適化された。
  • 高次元のポリシー空間のため、ベースライン探索を保証するため、ランダムサーチをレベル0の戦略として用いた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。