Skip to main content
QUICK REVIEW

[논문 리뷰] Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning

Thang Doan, Bogdan Mazoure|arXiv (Cornell University)|2019. 09. 17.
Reinforcement Learning in Robotics참고 문헌 30인용 수 8
한 줄 요약

이 논문은 연속 제어를 위한 인구 기반 강화 학습 방법인 유도-역류 액터-크리틱(ARAC)을 제안한다. 이 방법은 정규화 흐름(NF)을 사용하여 정책 간의 상호작용을 통해 구조화된 탐색을 가능하게 한다. 상호작용은 정책 간의 쌍방향 유인과 반발력을 기반으로 하며, NF로 파arameter화된 정책 간의 KL 발산을 활용함으로써 ARAC는 MuJoCo 벤치마크에서 뛰어난 샘플 효율성과 성능을 달성한다. 특히 유혹적인 고차원 이착렬 환경에서 SAC 및 기타 기준 모델을 능가한다.

ABSTRACT

Continuous control tasks in reinforcement learning are important because they provide an important framework for learning in high-dimensional state spaces with deceptive rewards, where the agent can easily become trapped into suboptimal solutions. One way to avoid local optima is to use a population of agents to ensure coverage of the policy space, yet learning a population with the "best" coverage is still an open problem. In this work, we present a novel approach to population-based RL in continuous control that leverages properties of normalizing flows to perform attractive and repulsive operations between current members of the population and previously observed policies. Empirical results on the MuJoCo suite demonstrate a high performance gain for our algorithm compared to prior work, including Soft-Actor Critic (SAC).

연구 동기 및 목표

  • 고차원적이고 다모드적인 보상 지도에서 국소 최적점에 갇히는 문제를 해결하기 위해.
  • 보상이 농축된 환경(예: MuJoCo)에서 표준 알고리즘이 속임수적인 역학으로 인해 부분 최적 정책에 수렴할 수 있는 문제를 개선하기 위해.
  • 파arameter 공간이 아닌 정책 공간에서의 유도와 반발력을 통해 다양성을 강제함으로써 인구 기반 탐색을 향상시키기 위해.
  • 더 표현력 있고 안정적인 정책 표현을 가능하게 하며, 효과적인 KL 기반 발산 계산을 지원하기 위해 정규화 흐름을 활용하기 위해.
  • 복잡한 이동 작업에서 단일 에이전트 및 이전의 인구 기반 방법보다 더 빠른 수렴과 높은 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 이 방법은 각각 정규화 흐름(NF)으로 파arameter화된 정책을 가진 에이전트의 집단을 사용하며, 이는 타당한 밀도 추정이 가능한 비정규분포 정책 분포를 가능하게 한다.
  • 유도-역류(AR) 손실이 도입되며, 정책 간의 KL 발산을 사용하여 다양성을 촉진한다: 유사한 정책 간에는 반발력을, 높은 성능을 보인 父정책에는 유도를 유도한다.
  • AR 목적함수는 소프트 액터-크리틱(SAC) 프레임워크에 통합되며, 반발력 강도를 제어하는 하이퍼파라미터 λ가 존재한다.
  • 이중 모달 아카이브는 고성능 및 다양한 정책을 저장하며, 이로부터 父정책을 샘플링하여 유도를 유도함으로써 장기적인 정책 커버리지 보장을 한다.
  • NF 정책 간의 KL 발산을 계산함으로써, 분산 붕괴와 평균 발산을 겪는 정규분포 정책에서 나타나는 문제를 피하는 안정적이고 표현력 있는 반발력이 가능해진다.
  • 전반적인 손실은 SAC의 표준 목적함수와 AR 손실을 조합하여 성능과 다양성의 동시 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1정책 공간에서의 유도-역류 메커니즘이 연속 제어 강화 학습에서 탐색과 일반화를 향상시킬 수 있는가?
  • RQ2정규분포 정책 대신 정규화 흐름을 사용할 경우, 더 안정적이고 효과적인 유도-역류 역학이 유도되는가?
  • RQ3ARAC는 MuJoCo 이동 작업에서 샘플 효율성과 최종 성능 측면에서 SAC 및 기타 인구 기반 방법보다 어떻게 비교되는가?
  • RQ4표준 알고리즘이 실패하는 희박한 보상 환경에서도 ARAC는 성공적으로 학습할 수 있는가?
  • RQ5AR 메커니즘이 행동 공간의 더 나은 커버리지와 엉킨, 중복된 정책의 회피에 기여하는가?

주요 결과

  • ARAC는 모든 MuJoCo 연속 제어 작업에서 소프트 액터-크리틱(SAC) 및 기타 기준 모델을 능가하며, 더 높은 최종 성능과 더 빠른 수렴을 달성한다.
  • Ant-v2 및 Humanoid-v2 환경에서 ARAC는 각각 100만 번째 환경 스텝 이내에 누적 수익 6,000과 4,000을 달성했으며, 단일 SAC 에이전트는 각각 400만, 300만 번째 스텝이 필요했다.
  • 희박한 보상 환경인 SparseHumanoid-v2에서 ARAC는 유일하게 비영점 성능을 달성했으며, 희박한 보상에 대한 강건성을 입증했다.
  • 절단 실험 결과, 반발력이 없을 경우(λ=0) 에이전트의 행동이 행동 공간에서 엉키게 되지만, λ>0일 경우 서로 다른 영역을 탐색함으로써 효과적인 다양성 강제가 이루어짐을 확인했다.
  • 정규분포 정책 대신 NF 정책을 사용함으로써, 반발력 하에서 분산 붕괴와 평균 발산을 방지할 수 있었으며, 이는 더 안정적이고 효과적인 탐색을 가능하게 했다.
  • t-SNE 시각화 결과, NF 정책 하에서의 반발력은 정규분포 정책이 다양성을 유지하지 못하는 것과는 달리, 에이전트 간 행동 분포의 더 나은 분리가 이루어짐을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.