Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Incentivize Other Learning Agents

Jiachen Yang, Ang Li|arXiv (Cornell University)|Jun 10, 2020
Reinforcement Learning in Robotics参考文献 42被引用数 17
ひとこと要約

本論文では、他のエージェントの行動を形作り、集団的な成果を向上させるために報酬を与えることで学習する『学習による他者へのインcentivization(LIO)』を提案する。LIOエージェントは、インセンティブが他者の学習に与える影響、そしてそれによって自らのパフォーマンスに与える影響を明示的にモデル化することで、一般和Markovゲームにおいてほぼ最適な協力を達成する。エスケープルームやクリーンアップ環境といったタスクにおいて、標準的な強化学習(RL)および相手形状ベースラインと比較して顕著に優れた性能を発揮する。

ABSTRACT

The challenge of developing powerful and general Reinforcement Learning (RL) agents has received increasing attention in recent years. Much of this effort has focused on the single-agent setting, in which an agent maximizes a predefined extrinsic reward function. However, a long-term question inevitably arises: how will such independent agents cooperate when they are continually learning and acting in a shared multi-agent environment? Observing that humans often provide incentives to influence others' behavior, we propose to equip each RL agent in a multi-agent environment with the ability to give rewards directly to other agents, using a learned incentive function. Each agent learns its own incentive function by explicitly accounting for its impact on the learning of recipients and, through them, the impact on its own extrinsic objective. We demonstrate in experiments that such agents significantly outperform standard RL and opponent-shaping agents in challenging general-sum Markov games, often by finding a near-optimal division of labor. Our work points toward more opportunities and challenges along the path to ensure the common good in a multi-agent future.

研究の動機と目的

  • 共有環境において、目的が不一致する独立して学習するRLエージェント間の協力を解決すること。
  • 固定された報酬関数の限界を克服し、エージェントが他者の行動に影響を与えるために報酬を与えることを学習可能にする。
  • インセンティブの長期的影響が受取人の学習およびエージェント自身の外的目標に与える影響を考慮する手法を開発すること。
  • 学習されたインセンティブ関数を通じて、協働タスクにおける効率的な分業をエージェントが発見できることを可能にすること。
  • 標準的なRLおよび相手形状アプローチと比較して、学習されたインセンティブ化が個々のパフォーマンスおよび集団的パフォーマンスを向上させることを示すこと。

提案手法

  • エージェントは、他の学習エージェントに報酬を与えるインセンティブ関数を学習し、そのインセンティブが受取人のポリシー更新に与える影響を明示的にモデル化する。
  • エージェントの外的目標に対するインセンティブ関数のパラメータに関する勾配を導出し、ポリシーグラデント法を用いたエンドツーエンドの学習を可能にする。
  • インセンティブ更新とポリシー更新を別々のエピソードで行うことで、分散を低減し、学習の安定性を向上させる。
  • インセンティブ更新とポリシー更新が同じエピソード内で行われる場合、分布シフトを緩和するために重要度サンプリング補正を用いる。
  • エージェントはポリシーグラデント最適化を用いて訓練され、インセンティブ関数はエージェントの総外的リターンを最大化するように同時に最適化される。
  • このフレームワークは、エスケープルームやクリーンアップのような一般和Markovゲームに適用され、エージェントが協力してより高い集団的報酬を達成する必要がある。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、他者の学習に間接的に影響を与えることで、自らの長期的外的パフォーマンスを向上させるような報酬を他者に与える方法を学習できるか?
  • RQ2マルチエージェント協働設定において、学習されたインセンティブ化は標準的独立RLおよび相手形状法と比較してどのように異なるか?
  • RQ3固定された報酬形状ではなく、学習されたインセンティブを通じてエージェントは効率的な分業を発見できるか?
  • RQ4インセンティブ更新とポリシー更新を分離することの学習安定性およびパフォーマンスへの影響は何か?
  • RQ5複雑で非対称な環境において、他者の学習をインセンティブで形作ることで、集団的および個々のリターンが向上するか?

主な発見

  • 2人用エスケープルームゲームでは、LIOエージェントが合計報酬約9.0に達し、グローバルマックスイムに近づいたが、標準的PGおよびPG-rewardsエージェントはグローバルミニマに閉じ込められていた。
  • LIOは、はるかに多くの訓練ステップを要し、収束の信頼性が低いLOLAおよび2-TS手法を上回った。
  • 3人用エスケープルームゲームでは、LIOにより1人のエージェントが主な報酬提供者となり、他のエージェントがレバーを引くようインcentivizedされ、成功した協力が実現した。
  • 7x7クリーンアップ環境では、LIOエージェントは安定した分業を学習した:1人はリンゴ収穫に専念し、もう1人はゴミの片付けに専念し、収穫者からのインセンティブによって動機づけられた。
  • LIOエージェントは、ゴミを片付けた後もリンゴをめぐって競争するACエージェントよりも高い平均報酬を得た。これは、共同で劣悪な結果に終わった。
  • 10x10のマップでは、LIOエージェントはスクリプトされた相手ポリシーに適応してインセンティブを効果的に調整でき、動的環境における頑健性と適応性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。