Skip to main content
QUICK REVIEW

[論文レビュー] Learning Latent Representations to Influence Multi-Agent Interaction

Annie Xie, Dylan P. Losey|arXiv (Cornell University)|Nov 12, 2020
Reinforcement Learning in Robotics参考文献 53被引用数 13
ひとこと要約

本論文では、マルチエージェント相互作用における非定常的エージェントの行動をモデル化・影響するために、潜在戦略を学習する強化学習フレームワークLILIを提案する。他のエージェントの方策を動的潜在変数として表現し、潜在動的モデルを活用することで、エゴエージェントは相手の行動を予測し、共適応的行動へ誘導する。シミュレーションおよび実世界のアイスホッケーにおいて、91%のシュートをブロックし、相手を高報酬戦略へ誘導することで、ベースラインを上回る性能を発揮した。

ABSTRACT

Seamlessly interacting with humans or robots is hard because these agents are non-stationary. They update their policy in response to the ego agent's behavior, and the ego agent must anticipate these changes to co-adapt. Inspired by humans, we recognize that robots do not need to explicitly model every low-level action another agent will make; instead, we can capture the latent strategy of other agents through high-level representations. We propose a reinforcement learning-based framework for learning latent representations of an agent's policy, where the ego agent identifies the relationship between its behavior and the other agent's future strategy. The ego agent then leverages these latent dynamics to influence the other agent, purposely guiding them towards policies suitable for co-adaptation. Across several simulated domains and a real-world air hockey game, our approach outperforms the alternatives and learns to influence the other agent.

研究の動機と目的

  • エゴエージェントの行動に応じて他エージェントが方策を変化させる非定常的マルチエージェント相互作用の課題に対処すること。
  • 低レベルの行動を明示的にモデル化せずに、他エージェントの潜在戦略を予測・影響できることを可能にすること。
  • 集中型トレーニングや通信を必要とせず、人間-ロボットや分散型環境に適した汎用フレームワークを構築すること。
  • エゴエージェントの行動が他エージェントの潜在戦略の時間的変化に与える影響を学習することで、共適応を向上させること。
  • 複雑でノイズが多く、マルコフ的でない相互作用状況においても頑健であることを示すこと。

提案手法

  • エゴエージェントは、他エージェントの観測行動から低次元の潜在戦略表現(z)を変分推論に基づいて推論する。
  • 潜在動的モデルは、エゴエージェントの行動に応じた他エージェントの戦略の進化を学習し、将来の戦略予測を可能にする。
  • エゴエージェントの方策は強化学習により訓練され、現在の潜在戦略への対応に加え、将来の戦略を共適応的結果へと影響させるようにする。
  • 逆強化学習と潜在変数モデリングを組み合わせることで、他エージェントの隠れた方策を特定・予測する。
  • オフポリシー深層強化学習(SAC)を用いてエンドツーエンドで訓練し、相手の戦略に影響を与えるよう報酬形状を設計する。
  • 本手法は、シミュレーテッド環境およびロボットと人間の相手を対象とした実世界のアイスホッケー設定でも評価された。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、部分観測可能な非定常的エージェントの潜在戦略を学習し、予測可能か?
  • RQ2学習された潜在動的モデルを活用することで、エゴエージェントは他エージェントの将来戦略を能動的に影響し、より良い共適応を実現できるか?
  • RQ3潜在戦略への影響を学習することで、アイスホッケーのような実世界のマルチエージェントタスクで性能が向上するか?
  • RQ4ノイズや非マルコフ的依存関係を含む相手の行動に対して、本手法はどの程度頑健か?
  • RQ5実世界環境において、ロボット相手から人間相手へまで本フレームワークは一般化可能か?

主な発見

  • 実世界のアイスホッケー実験では、LILIは最終100回の相互作用において91%のシュートブロック成功率を達成し、SAC(44%)およびランダムベースライン(18%)を大きく上回った。
  • LILIは、左側へのシュートを促す報酬をエゴエージェントが得られるように設定した結果、ロボット相手を左側へ41%の確率で発射させることに成功した。
  • 人間エキスパート相手とのテストでは、LILI(影響なし)は40本中29本(73%)のシュートをブロックしたのに対し、SACは40本中18本(45%)だった。これは、LILIの優れた共適応性能を示している。
  • LILIは、相手を左と真ん中を交互に選ぶ戦略へ誘導し、相手が以前にブロックされた領域を避ける傾向を利用した。
  • 長時間スパンの依存関係を伴うアブレーションスタディにより、ノイズの多い潜在動的モデルや非マルコフ的戦略進化に対しても本手法の頑健性が示された。
  • 最終段階では、LILIは1回の相互作用あたり平均累積報酬1.15 ± 0.05を達成したのに対し、影響なしのLILIでは1.00 ± 0.05であった。これは、能動的影響の価値を確認するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。