Skip to main content
QUICK REVIEW

[論文レビュー] Coordination-driven learning in multi-agent problem spaces

Sean L. Barton, Nicholas R. Waytowich|arXiv (Cornell University)|Sep 13, 2018
Reinforcement Learning in Robotics参考文献 10被引用数 5
ひとこと要約

本論文は、因果的連携測度(CCM)と呼ばれる新しい連携指標を導入することで、マルチエージェント強化学習(MARL)におけるエージェント間連携を直接的な学習目的として最適化する手法を提案する。CCMは行動の相関関係を定量化する。CCMを学習損失に統合することで、エージェントは自己組織的行動に依存するのではなく、明示的に連携を学習するようになり、捕食者・獲物の追跡といった敵対的・協力的タスクにおいて、著しく高い耐障害性を示す。

ABSTRACT

We discuss the role of coordination as a direct learning objective in multi-agent reinforcement learning (MARL) domains. To this end, we present a novel means of quantifying coordination in multi-agent systems, and discuss the implications of using such a measure to optimize coordinated agent policies. This concept has important implications for adversary-aware RL, which we take to be a sub-domain of multi-agent learning.

研究の動機と目的

  • 複雑または敵対的な環境において、マルチエージェント強化学習(MARL)における保証された連携の欠如に対処すること。
  • 性能のみを指標とする手法の限界を克服し、学習中に真の連携を捉えることができない点を改善すること。
  • 自己組織的連携に依存するのではなく、明示的にエージェントの方策を連携行動に向かって形状づける手法を開発すること。
  • 協力的パートナーや人間エージェントとの信頼性の高い協働を可能にするために、エージェントが inherently 連携するよう駆動されることを保証すること。
  • 敵対的攻撃に対して耐性を高めるために、連携方策を通じて敵対的行動を予測・対抗できるように訓練すること。

提案手法

  • エージェント行動間の因果的影響を測定できる新しい連携指標、因果的連携測度(CCM)を導入する。
  • バックプロパゲーション中に損失関数にCCMを組み込むことで、CCMを学習目的の直接的信号として使用する。
  • CCMを補助報酬または損失における正則化項として適用し、方策学習を連携行動に向かって形状づける。
  • 3体の捕食者と1体の獲物からなる連続的2次元の捕食者・獲物追跡環境に本手法を実装し、連携ダイナミクスをテストする。
  • 訓練中に連携の閾値を変化させ、連携度を制御し、それがタスクパフォーマンスに与える影響を観察する。
  • エージェントがタスク成功(スコア)とエージェント間連携を最適化するようにCCMを用いて学習を誘導し、自己中心的または振動的方策を回避する。

実験結果

リサーチクエスチョン

  • RQ1因果的指標を用いて、マルチエージェントシステムにおける連携を測定可能な信号として効果的に定量化できるか?
  • RQ2CCMを用いて連携を明示的に最適化することで、性能のみを目的とする学習目的と比較して、より優れたタスクパフォーマンスが得られるか?
  • RQ3連携の閾値を変化させることで、方策学習、連携品質、およびMARLにおけるタスク成果にどのような影響が生じるか?
  • RQ4連携駆動型学習は、MARL環境における敵対的攻撃に対して耐性を高めることができるか?
  • RQ5CCMは、集団的成果を損なうおそれがある自己中心的方策にエージェントが収束するのをどの程度防げるか?

主な発見

  • 因果的連携測度(CCM)は、行動間の因果的影響を測定することで、学習中の信頼性の高い信号としてエージェント間連携を効果的に定量化できた。
  • CCMを学習損失に統合した場合、自然に連携が生じない複雑な環境でも、エージェントは明示的に連携行動を学習するようになった。
  • CCMを用いた訓練では、高いタスクパフォーマンスを達成しても意味のある連携が得られない、従来のMARL手法と比較して、はるかに高い安定性と連携レベルを達成した。
  • 望ましい閾値を設定することで、連携レベルを実験的に制御可能となり、連携の影響を体系的に調査できるようになった。
  • 連携駆動型学習により、集団的成果を損なう自己中心的方策にエージェントが収束するリスクが低減した。
  • 捕食者・獲物の追跡タスクでは、CCMベースの訓練により、グループによる獲物の追い込み行動が明確に観察され、非連携方策に比べて著しく捕食成功確率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。