Skip to main content
QUICK REVIEW

[論文レビュー] A Formal Solution to the Grain of Truth Problem

Jan Leike, Jessica Taylor|arXiv (Cornell University)|Sep 16, 2016
Computability, Logic, AI Algorithms参考文献 8被引用数 5
ひとこと要約

この論文は、すべての計算可能確率的方策とそのベイズ最適対応方策を含む、反射的オラクル計算可能環境のクラスを導入することで、マルチエージェント強化学習における真の粒問題を形式的に解決する。このクラス上でトンプソンサンプリングを用いることで、未知の計算可能マルチエージェント環境において、エージェントは漸近的にε-ナッシュ均衡に収束し、ベイズ的エージェントが失敗する可能性がある場面でも漸近的最適性を達成する。

ABSTRACT

A Bayesian agent acting in a multi-agent environment learns to predict the other agents' policies if its prior assigns positive probability to them (in other words, its prior contains a \emph{grain of truth}). Finding a reasonably large class of policies that contains the Bayes-optimal policies with respect to this class is known as the \emph{grain of truth problem}. Only small classes are known to have a grain of truth and the literature contains several related impossibility results. In this paper we present a formal and general solution to the full grain of truth problem: we construct a class of policies that contains all computable policies as well as Bayes-optimal policies for every lower semicomputable prior over the class. When the environment is unknown, Bayes-optimal agents may fail to act optimally even asymptotically. However, agents based on Thompson sampling converge to play ε-Nash equilibria in arbitrary unknown computable multi-agent environments. While these results are purely theoretical, we show that they can be computationally approximated arbitrarily closely.

研究の動機と目的

  • すべての計算可能方策とそのベイズ最適対応方策を含む方策クラスを構築することで、マルチエージェント強化学習における真の粒問題を解決すること。
  • 未知の環境において十分な探索が行われないため、最適に行動できない可能性があるベイズ的エージェントの限界を克服すること。
  • 一般の計算可能マルチエージェント環境において、エージェントが漸近的最適性を達成し、均衡に収束するための条件を確立すること。
  • 反射的オラクル計算可能方策が、理論的に最適な行動の計算可能な近似を可能にすることを示すこと。

提案手法

  • すべての計算可能確率的方策と下半再帰的事前分布のベイズ最適方策を含む十分に大きな反射的オラクル計算可能環境のクラスを構築する。
  • 反射的オラクルを用いる。反射的オラクルとは、再帰的にオラクルを問い合わせる確率的チューリングマシンの出力確率に関する質問に答える確率的オラクルである。
  • 十分な探索を保証する方策選択メカニズムとしてトンプソンサンプリングを用い、未知の環境においてε-ナッシュ均衡への収束を実現する。
  • 理論的結果が計算的に近似可能であることを保証するため、方策クラスの極限計算可能性を確立する。
  • 一般強化学習におけるトンプソンサンプリングの漸近的最適性に関する先行研究の結果を、マルチエージェント設定に応用する。
  • エージェントの各々の方策が、共同環境ダイナミクスのもとで、確率的に1に近づく割合でε最良応答となることを示すことで、ε-ナッシュ均衡への収束を証明する。

実験結果

リサーチクエスチョン

  • RQ1真の粒問題を解決できる、すべての計算可能方策とそのベイズ最適対応方策を含む単一の方策クラスを構築することは可能か?
  • RQ2ベイズ的エージェントは、未知のマルチエージェント環境において、どのような条件下で最適に行動できず、なぜそうなるのか?
  • RQ3適切な環境クラス上でトンプソンサンプリングを用いることで、任意の未知の計算可能マルチエージェント環境においてε-ナッシュ均衡への収束を保証できるか?
  • RQ4理論的に最適な解を計算的に近似することは可能か?

主な発見

  • 反射的オラクル計算可能環境のクラスは、すべての計算可能確率的方策と、下半再帰的事前分布のすべてのベイズ最適方策を含み、真の粒問題を解決する。
  • ベイズ的エージェントは、真の粒を持っている場合でも、十分な探索が行われないため、未知の環境では最適に行動できない可能性がある。
  • 反射的オラクル計算可能クラス上でトンプソンサンプリングを用いることで、任意の未知の計算可能マルチエージェント環境において、エージェントは漸近的にε-ナッシュ均衡に収束する。
  • 方策クラスは極限計算可能であるため、理論的解の任意に近い計算的近似が可能である。
  • 任意のε > 0に対して、時間t → ∞のとき、各エージェントの方策がε最良応答である確率は1に収束する(共同環境ダイナミクスのもとで)。
  • エージェントが事前に環境構造を知らない場合でも、例えば繰り返しマッチングペニー、または未知のゲームの状況でも、この結果は成り立つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。