Skip to main content
QUICK REVIEW

[논문 리뷰] Curiosity-driven Exploration in Sparse-reward Multi-agent Reinforcement Learning

Jiong Li, Pratik Gajane|arXiv (Cornell University)|2023. 02. 21.
Behavioral Health and Interventions인용 수 4
한 줄 요약

이 논문은 희소 보상 다중 에이전트 강화 학습에서 샘플 효율성을 향상시키기 위해 내재적 호기심 모듈(ICM)과 Go-Explore 프레임워크를 결합한 새로운 방법 I-Go-Explore를 제안한다. 내재적 호기심과 Go-Explore의 궤적 기반 탐색을 융합함으로써 탈락과 이탈 문제를 줄이고, 특히 장기 과제에서 훨씬 더 빠른 학습과 향상된 성능을 달성한다. 다중 에이전트 사냥 환경에서 12%의 학습 시간 감소와 더불어 누적 보상이 뛰어나다는 것이 입증되었다.

ABSTRACT

Sparsity of rewards while applying a deep reinforcement learning method negatively affects its sample-efficiency. A viable solution to deal with the sparsity of rewards is to learn via intrinsic motivation which advocates for adding an intrinsic reward to the reward function to encourage the agent to explore the environment and expand the sample space. Though intrinsic motivation methods are widely used to improve data-efficient learning in the reinforcement learning model, they also suffer from the so-called detachment problem. In this article, we discuss the limitations of intrinsic curiosity module in sparse-reward multi-agent reinforcement learning and propose a method called I-Go-Explore that combines the intrinsic curiosity module with the Go-Explore framework to alleviate the detachment problem.

연구 동기 및 목표

  • 희소 보상 다중 에이전트 환경에서 딥 강화 학습의 샘플 비효율 문제를 해결한다.
  • 탐색 과정에서 내재적 호기심 모듈(ICM)이 내재하는 탈락과 이탈 문제를 극복한다.
  • ICM을 Go-Explore 프레임워크와 통합하여 장기적인 궤적 다양성을 유지함으로써 탐색 효율성을 향상시킨다.
  • 부분 관측 가능하고 협력-경쟁 혼합 다중 에이전트 환경에서 방법의 강건성을 평가한다.
  • 내재적 호기심과 구조화된 탐색의 조합이 더 빠른 수렴과 더 높은 누적 보상으로 이어진다는 것을 입증한다.

제안 방법

  • 상태 전이의 예측 오차를 기반으로 내재적 보상을 생성하기 위해 내재적 호기심 모듈(ICM)을 통합한다.
  • 고-익스플로어 프레임워크를 적용하여 고보상 궤적을 유지하고 재방문함으로써 유망한 경로의 조기 기각을 방지한다.
  • 중앙집중식 훈련과 분산 실행(CTDE) 설정을 활용하여, 정책 최적화에 대해 MADDPG를 사용한다.
  • 에이전트가 먼저 ICM 기반 호기심으로 탐색한 후, Go-Explore의 궤적 메모리로 유망한 궤적을 이용하는 단계별 탐색 구조를 설계한다.
  • 발견된 고수익 궤적을 메모리에 유지하여 향후 탐색을 안내하고 탈락을 줄인다.
  • ICM의 예측 오차와 환경 제공 희소 보상의 조합을 통해 내재적 보상과 외재적 보상을 균형 있게 조정한다.

실험 결과

연구 질문

  • RQ1ICM과 Go-Explore를 조합함으로써 희소 보상 다중 에이전트 강화 학습에서 탈락 문제를 완화할 수 있는가?
  • RQ2장기 과제에서 ICM과 비교해 I-Go-Explore가 샘플 효율성을 향상시키는가?
  • RQ3부분 관측 가능 환경에서 탐색 단계 길이가 I-Go-Explore의 성능에 어떤 영향을 미치는가?
  • RQ4혼합 협력-경쟁 설정에서 I-Go-Explore는 ICM에 비해 학습 시간과 누적 보상 측면에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5내재적 호기심과 궤적 기반 탐색의 통합이 복잡한 다중 에이전트 환경에서 더 안정적이고 확장 가능한 학습을 이끌어내는가?

주요 결과

  • I-Go-Explore는 ICM 대비 약 12%의 학습 시간 감소를 기록했으며, 동일 하드웨어에서 I-Go-Explore는 15,805초, ICM은 18,005초가 소요되었다.
  • I-Go-Explore에서 사냥개는 평균 보상 -268.83을 기록하여 ICM의 -786.62보다 유의미하게 높았으며, 이는 더 나은 회피 및 생존 전략을 의미한다.
  • I-Go-Explore의 사냥개는 평균 보상 8.88을 기록하여 ICM의 16.76보다 높았으며, 이는 향상된 협력과 추적 효율성을 시사한다.
  • 단기 학습(10단계)에서는 ICM이 사냥개에서 약간 더 뛰어난 성능을 보였지만, 장기 학습(20단계)에서는 I-Go-Explore가 더 뛰어나고 안정적인 성능을 보였다.
  • 짧은 탐색 단계(10단계)를 가진 I-Go-Explore가 더 긴 탐색 단계를 가진 I-Go-Explore와 ICM 모두를 능가했으며, 이는 과도한 무작위 탐색이 정책 학습을 악화시킬 수 있음을 시사한다.
  • 고수익 궤적을 유지하고 재사용함으로써 탈락을 성공적으로 줄였고, 이로 인해 에이전트가 에피소드 간에 진전을 유지할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.