Skip to main content
QUICK REVIEW

[논문 리뷰] Emergent Social Learning via Multi-agent Reinforcement Learning

Kamal Ndousse, Douglas Eck|arXiv (Cornell University)|2020. 10. 01.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 다중 에이전트 강화학습(MARL) 에이전트가 전문가를 관찰하고 따라하는 사회적 학습을 통해 복잡한 행동을 학습하고 새로운 환경으로 일반화할 수 있음을 보여준다. 모델 기반 보조 손실과 사회적 학습 및 단독 학습을 혼합함으로써 에이전트는 전문가 신호를 기회에 따라 활용하게 되며, 제로샷 전이와 단독 성능에서 애자일 학습 또는 단독 학습 에이전트보다 뛰어난 성능을 보인다.

ABSTRACT

Social learning is a key component of human and animal intelligence. By taking cues from the behavior of experts in their environment, social learners can acquire sophisticated behavior and rapidly adapt to new circumstances. This paper investigates whether independent reinforcement learning (RL) agents in a multi-agent environment can learn to use social learning to improve their performance. We find that in most circumstances, vanilla model-free RL agents do not use social learning. We analyze the reasons for this deficiency, and show that by imposing constraints on the training environment and introducing a model-based auxiliary loss we are able to obtain generalized social learning policies which enable agents to: i) discover complex skills that are not learned from single-agent training, and ii) adapt online to novel environments by taking cues from experts present in the new environment. In contrast, agents trained with model-free RL or imitation learning generalize poorly and do not succeed in the transfer tasks. By mixing multi-agent and solo training, we can obtain agents that use social learning to gain skills that they can deploy when alone, even out-performing agents trained alone from the start.

연구 동기 및 목표

  • 독립적인 딥 강화학습 에이전트가 명시적 지도나 모방 학습 없이 사회적 학습을 학습할 수 있는지 조사하기.
  • 공동 보상이나 지도를 유도할 만한 동기가 없더라도 사회적 학습이 다중 에이전트 환경에서 어떻게 발생하는지 조건을 규명하기.
  • 실시간으로 전문가 신호를 통해 학습함으로써 비용이 많이 드는 개별 탐색을 줄이고 일반화 능력을 향상시키기.
  • 에이전트가 사회적 학습을 통해 습득한 기술을 단독 환경에서 유지할 수 있도록 하는 훈련 제도 개발하기.
  • 사회적 학습을 통한 강화학습가 애자일 학습 및 단독 학습보다 전이 능력과 성능에서 뛰어나다는 것을 입증하기.

제안 방법

  • 높은 개별 탐색 비용과 명성 신호를 갖춘 다중 에이전트 환경을 설계하여 사회적 학습을 유도하기.
  • 모델 기반 보조 손실을 갖춘 모델리스 PPO 에이전트를 사용하여 다른 에이전트의 정책을 암묵적으로 예측하고 모델링하기.
  • 전문가가 없는 경우와 있는 경우를 번갈아가며 훈련 에피소드를 실행하여 전문가에 대한 과도한 의존 방지하기.
  • 유용할 경우에만 전문가를 선택적으로 따라가면서도 강력한 개별 성능를 유지하도록 에이전트를 훈련하기.
  • 전문가 행동을 추정하기 위한 예측 헤드를 사용하여, 명시적 보상 형상 조정 없이도 다른 이의 행동에서 학습할 수 있도록 하기.
  • 새로운 환경에 새로운 전문가가 등장할 때의 제로샷 전이를 통해 일반화 능력 평가하기.

실험 결과

연구 질문

  • RQ1독립적인 딥 RL 에이전트는 개별 탐색으로는 발견할 수 없는 복잡한 행동을 사회적 학습을 통해 학습할 수 있는가?
  • RQ2사전 노출 없이 새로운 전문가를 관찰함으로써 온라인에서 새로운 환경에 적응할 수 있는가?
  • RQ3애자일 학습이나 단독 학습과 비교해 사회적 학습이 일반화 능력을 향상시키는가?
  • RQ4사회적 학습을 통해 훈련된 에이전트는 단독 환경에서만 훈련된 에이전트보다 성능이 뛰어나게 되는가?
  • RQ5MARL 환경에서 사회적 학습이 발생하기 위해 필요한 환경적 및 훈련 조건는 무엇인가?

주요 결과

  • 모델 기반 보조 손실을 적용한 에이전트는 사회적 학습을 성공적으로 학습하지만, 순수한 모델리스 RL 에이전트는 이를 수행하지 못한다.
  • 사회적 학습은 고비용 탐색 환경에서 최적의 탐색과 같은 복잡한 기술을 발견할 수 있도록 도와주며, 이는 단독 학습으로는 습득되지 않는다.
  • 사회적 학습과 단독 학습을 혼합해 훈련한 에이전트는 전문가가 없는 환경에서도 전적으로 단독 학습한 에이전트보다 뛰어난 성능을 보인다.
  • 새로운 전문가가 있는 새로운 환경으로의 제로샷 전이에서, 사회적 학습을 한 에이전트는 단독 학습 에이전트와 애자일 학습 에이전트보다 뚜렷이 뛰어난 성능을 보인다.
  • 애자일 학습은 전문가 성능과 유사하게 나타나지만 새로운 전문가에 적응하지 못하지만, 사회적 학습을 한 에이전트는 새로운 전문가의 신호를 적극적으로 찾고 활용한다.
  • 훈련 중 전문가에 과도하게 의존하면 단독 성능이 떨어지며, 단독 학습과 사회적 학습을 번갈아 훈련함으로써 이 문제를 완화하고 강건한 일반화를 달성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.