Skip to main content
QUICK REVIEW

[論文レビュー] Emergent Social Learning via Multi-agent Reinforcement Learning

Kamal Ndousse, Douglas Eck|arXiv (Cornell University)|Oct 1, 2020
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

この論文は、マルチエージェント強化学習(MARL)エージェントが、専門家を観察し模倣することで、複雑な行動を学び、新しい環境に一般化できることを示している。モデルベースの補助損失を導入し、社会的学習と単独学習を混合させることで、エージェントは専門家の手がかりを機会的に活用するよう学習し、ゼロショット転送および卾単独性能において、単独学習エージェントや模倣学習エージェントを上回る性能を発揮する。

ABSTRACT

Social learning is a key component of human and animal intelligence. By taking cues from the behavior of experts in their environment, social learners can acquire sophisticated behavior and rapidly adapt to new circumstances. This paper investigates whether independent reinforcement learning (RL) agents in a multi-agent environment can learn to use social learning to improve their performance. We find that in most circumstances, vanilla model-free RL agents do not use social learning. We analyze the reasons for this deficiency, and show that by imposing constraints on the training environment and introducing a model-based auxiliary loss we are able to obtain generalized social learning policies which enable agents to: i) discover complex skills that are not learned from single-agent training, and ii) adapt online to novel environments by taking cues from experts present in the new environment. In contrast, agents trained with model-free RL or imitation learning generalize poorly and do not succeed in the transfer tasks. By mixing multi-agent and solo training, we can obtain agents that use social learning to gain skills that they can deploy when alone, even out-performing agents trained alone from the start.

研究の動機と目的

  • 独立したディープ強化学習エージェントが、明示的な指導や模倣なしに社会的学習を学習できるかどうかを調査すること。
  • 共通の報酬や教えようとする動機がないマルチエージェント環境において、社会的学習がどのような条件下で出現するかを特定すること。
  • エージェントがリアルタイムで専門家の手がかりから学習することで、一般化性能を向上させ、高コストな個別的探索を削減すること。
  • エージェントが社会的学習で得たスキルを単独環境でも活用できるようにするトレーニング制度を開発すること。
  • 社会的学習によるRLが、模倣学習や単独学習を上回る転送性能および性能を示すことを実証すること。

提案手法

  • 高コストな個別的探索と権威的シグナル(プレステージ・キューや)を備えたマルチエージェント環境を設計し、社会的学習を促進する。
  • モデルフリーなPPOエージェントにモデルベースの補助損失を適用し、他のエージェントの方策を間接的に予測・モデリングする。
  • 専門家を含む訓練エピソードと含まないエピソードを交互に実施し、専門家の手がかりに過度に依存するのを防ぐ。
  • 有益な場合にのみ専門家に従うように選択的に学習させつつ、強固な個別的パフォーマンスを維持する。
  • 専門家の行動を推定する予測ヘッドを用いることで、明示的な報酬形状なしに他者から学習できるようにする。
  • 新しい環境に新しい専門家が登場する状況でのゼロショット転送を評価することで、一般化性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1独立したディープRLエージェントは、個別的探索では得られない複雑な行動を、社会的学習を用いて学習できるか?
  • RQ2事前に露出していない新しい専門家を観察することで、エージェントはオンラインで新しい環境に適応できるか?
  • RQ3模倣学習や単独学習と比較して、社会的学習は一般化性能を向上させるか?
  • RQ4社会的学習で訓練されたエージェントは、単独環境での訓練のみで学習したエージェントを上回れるか?
  • RQ5MARLにおいて社会的学習が出現するための環境的およびトレーニング的条件は何か?

主な発見

  • モデルベースの補助損失を用いて訓練されたエージェントは社会的学習を効果的に学習するが、バニラなモデルフリーRLエージェントはそのような学習に失敗する。
  • 社会的学習により、個別的学習では得られない複雑なスキル(例:高コストな探索環境における最適ナビゲーション)をエージェントが発見できる。
  • 社会的学習と単独学習の両方を混合して訓練したエージェントは、専門家が存在しない状況でも、単独学習のみで訓練されたエージェントを上回る性能を示す。
  • 新しい専門家が登場する新しい環境へのゼロショット転送において、社会的学習エージェントは、単独学習エージェントおよび模倣学習エージェントを著しく上回る。
  • 模倣学習は専門家のパフォーマンスと同等の性能を示すが、新しい専門家には適応できない。一方、社会的学習エージェントは新しい専門家の手がかりを積極的に求めて活用する。
  • 訓練中に専門家に過度に依存すると単独性能が低下するが、単独学習と社会的学習を交互にトレーニングすることで、この問題を緩和でき、頑健な一般化が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。