Skip to main content
QUICK REVIEW

[論文レビュー] Nested Reasoning About Autonomous Agents Using Probabilistic Programs

Iris Rubi Seaman, Jan-Willem van de Meent|arXiv (Cornell University)|Dec 4, 2018
Bayesian Modeling and Causal Inference参考文献 32被引用数 6
ひとこと要約

本稿では、高不確実性の追跡回避ゲームにおいて自律的エージェントが心の理論的推論を実行できるようにする、ネストされた確率的プログラムを用いた計画=推論フレームワークを提案する。チェイサーとランナーを、互いの推論をネストされた重要度サンプリングを通じてシミュレートする確率的条件付きエージェントとしてモデル化することで、合理的で逆計画的行動を達成し、推論レベル間での最適な計算予算配分により推定誤差の分散を低減する。

ABSTRACT

As autonomous agents become more ubiquitous, they will eventually have to reason about the plans of other agents, which is known as theory of mind reasoning. We develop a planning-as-inference framework in which agents perform nested simulation to reason about the behavior of other agents in an online manner. As a concrete application of this framework, we use probabilistic programs to model a high-uncertainty variant of pursuit-evasion games in which an agent must make inferences about the other agents' plans to craft counter-plans. Our probabilistic programs incorporate a variety of complex primitives such as field-of-view calculations and path planners, which enable us to model quasi-realistic scenarios in a computationally tractable manner. We perform extensive experimental evaluations which establish a variety of rational behaviors and quantify how allocating computation across levels of nesting affects the variance of our estimators.

研究の動機と目的

  • 部分的に観測可能で高不確実性の環境において、自律的エージェントが他のエージェントの意図や計画を推論できるフレームワークを開発すること。
  • 時間依存的に心の理論をモデル化し、オンライン意思決定中に他者の信念や行動について再帰的推論を可能とすること。
  • ネストされた推論レベル間での計算予算配分が、期待効用推定誤差の分散と検出性能に与える影響を評価すること。
  • ネストされたベイズ的推論が、非ネストモデルと比較して追跡回避タスクにおいてより合理的で効果的な行動をもたらすことを実証すること。

提案手法

  • 計画=推論を用いて、チェイサーとランナーのエージェントをそれぞれ検出尤度を最大化するように、および最小化するように確率的プログラムとして定式化する。
  • 複数の推論レベルにわたる再帰的推論を実行するため、ネストされた重要度サンプリングを採用し、連続的アクションを伴う扱いやすいオンライン計画を可能にする。
  • RRTルートプランナーや等視野(Isovist)ベースの視界計算といった、半現実的で決定論的なプリミティブを確率的モデルに統合する。
  • ドイツのブレーメンの点群データから抽出した粗い多角形都市地図を用いて、現実的な環境制約をシミュレートする。
  • 時間的経過と予算設定に応じた重要度サンプリング重みの分散を評価するため、有効サンプル数(ESS)の正規化を適用する。
  • 計算予算(K, L)を変化させた広範なシミュレーションを実施し、推定誤差の安定性と性能のトレードオフを評価する。

実験結果

リサーチクエスチョン

  • RQ1自律的エージェントは、部分的に観測可能で高不確実性の環境において、他のエージェントの計画についてどのようにネストされた推論を実行できるか?
  • RQ2異なるレベルのネストされた推論に計算リソースを割り当てる影響は、期待効用推定誤差の分散にどのような影響を及ぼすか?
  • RQ3ネストされたベイズ的推論は、非ネストモデルと比較して、追跡回避ゲームにおいてより合理的で効果的な行動をもたらすか?
  • RQ4モデルの複雑さと推論の質は、現実的で連続的アクションを伴う追跡回避設定における検出率にどのように影響するか?

主な発見

  • ネストされた確率的プログラミングフレームワークは、チェイサーとランナー両エージェントに対して合理的で逆計画的行動を効果的に生成し、チェイサーが推定されたランナーの意図に基づいて戦略を適応させることに成功している。
  • 推論の推論を含むモデルの複雑化により、非ネストモデルと比較して検出率が著しく向上している。
  • チェイサーの重みに対する有効サンプル数(ESS)は時間経過とともに増加しており、エピソード終盤にかけて検出確率が低下するにつれて推論が容易になる傾向が示されている。
  • 外側(チェイサー)モデルにより多くのサンプルを割り当てることで、期待効用推定誤差の分散が低減され、特に(K,L) = (16,128)のような設定で推定誤差のロバスト性が向上している。
  • チェイサーの対数平均重みは時間経過とともに想定通り低下しており、検出確率の低下を反映している一方、ランナーの重みは比較的安定している。
  • ボックスプロット分析により、Kが低くLが高い設定が、外れ値が少ないよりロバストな対数重みをもたらすことが確認され、外側モデルにより多くの計算を割り当てる利点が裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。