Skip to main content
QUICK REVIEW

[논문 리뷰] Divide-and-Conquer Reinforcement Learning

Dibya Ghosh, Avi Singh|arXiv (Cornell University)|2017. 11. 27.
Reinforcement Learning in Robotics참고 문헌 15인용 수 13
한 줄 요약

이 논문은 초기 상태 공간을 서로 다른 조각들로 분할하고, 각 조각에 대해 별도의 정책을 훈련한 후 KL 발산 제약과 정수화를 통해 점차 하나의 글로벌 정책으로 통합하는 Divide-and-Conquer 강화학습(DnC)을 소개한다. DnC는 초기 상태와 목표의 변동성이 높은 복잡한 로봇 조작 및 이동 작업에서 표준 정책 기울기 방법과 앙상블 기반 방법을 크게 능가한다.

ABSTRACT

Standard model-free deep reinforcement learning (RL) algorithms sample a new initial state for each trial, allowing them to optimize policies that can perform well even in highly stochastic environments. However, problems that exhibit considerable initial state variation typically produce high-variance gradient estimates for model-free RL, making direct policy or value function optimization challenging. In this paper, we develop a novel algorithm that instead partitions the initial state space into "slices", and optimizes an ensemble of policies, each on a different slice. The ensemble is gradually unified into a single policy that can succeed on the whole state space. This approach, which we term divide-and-conquer RL, is able to solve complex tasks where conventional deep RL methods are ineffective. Our results show that divide-and-conquer RL greatly outperforms conventional policy gradient methods on challenging grasping, manipulation, and locomotion tasks, and exceeds the performance of a variety of prior methods. Videos of policies learned by our algorithm can be viewed at http://bit.ly/dnc-rl

연구 동기 및 목표

  • 높은 확률적 초기 상태 및 목표 분포로 인해 발생하는 강화학습에서의 높은 분산 추정치를 해결하기 위해.
  • 표준 정책 기울기 방법이 초기 조건의 다양성으로 인해 실패하는 복잡한 로봇 작업—특히 조작 및 이동 작업—에서 효과적인 학습을 가능하게 하기 위해.
  • 상태공간의 서로 다른 조각들에 대해 전문화된 정책을 학습하고 이를 하나의 견고한 글로벌 정책으로 통합하는 방법을 개발하기 위해.
  • бог이나 동적 특성이 풍부하고 변동성이 높은 환경에서 샘플 복잡도를 줄이고 학습 안정성을 향상시키기 위해.
  • 지도 학습이나 고수준 액션 공간에 의존하지 않고, 저수준 토크 제어 공간에서 직접 훈련함으로써 이를 제거하기 위해.

제안 방법

  • 알고리즘은 상태 분포 특성에 기반해 초기 상태 공간을 여러 겹치지 않는 '조각들'로 나눈다.
  • 각 조각에 대해 표준 딥 강화학습을 사용해 별도의 정책을 훈련함으로써, 각 지역 내에서 낮은 분산 추정치를 확보한다.
  • 서로 다른 정책 간의 상호 KL 발산 제약을 통해 정책 일관성을 유도함으로써 정책을 점차 하나의 글로벌 정책으로 통합한다.
  • 지식 전이를 촉진하고 수렴 속도를 높이기 위해 정책 간에 지도 정수화를 적용한다. 특히 느리게 학습되는 정책에 유용하다.
  • 최종 글로벌 정책는 모든 조각을 아우르는 일반화 능력을 갖추어 전체 상태공간에서 일관된 행동을 달성하도록 훈련된다.
  • 중앙집중적 훈련, 분산 인fer 방식을 채택하며, 통합 훈련 중에 모든 조각 간에 정책 파rameter를 공유한다.

실험 결과

연구 질문

  • RQ1초기 상태 공간을 이산적인 조각들로 나누는 것이 고분산 강화학습 과제에서 학습 안정성과 샘플 효율성을 향상시키는가?
  • RQ2전체 분포에 대해 종단간 훈련을 하는 것과 비교해, 국소 상태공간 영역에서 별도의 정책을 훈련하는 것이 최종 성능과 수렴 속도 측면에서 어떻게 다른가?
  • RQ3서로 다른 정책 간의 상호 KL 제약과 정수화가 여러 전문화된 정책을 하나의 일반 목적 정책으로 효과적으로 통합할 수 있는가?
  • RQ4DnC는 초기 상태와 목표의 변동성이 높은 과제에서 표준 정책 기울기 방법과 이전의 앙상블 기반 접근법을 능가하는가?
  • RQ5DnC는 지도 데이터나 고수준 액션 추상화 없이도 저수준 토크 제어 공간에서 효과적인 정책을 학습할 수 있는가?

주요 결과

  • DnC는 평가된 모든 과제에서 가장 높은 최종 평균 수익을 기록했으며, TRPO, SAC 및 기타 기준 방법을 모두 능가했다.
  • Ant Position 이동 과제에서 DnC는 TRPO가 4억 개의 샘플이 필요로 했던 것의 약 1/10에 불과한 샘플 복잡도로 과제를 해결했다.
  • 계단 이동 과제에서는 짧은 계단에 대해 걸음걸이를, 높은 계단에 대해선 점프 동작을 학습하며 모든 높이에서 성능를 유지했다.
  • DnC는 기준 방법보다 더 견고하고 일반화 능력이 뛰어난 정책을 학습했으며, 짧은 계단에서 실패하는 뛰는 걸음걸이 같은 취약한 행동을 피했다.
  • 중앙집중적 DnC 버전이 모든 과제에서 최고의 성능를 기록했으며, 정책 간 제약 조건을 통합한 훈련의 효과를 입증했다.
  • 그러나 조작 과제인 집기 및 잡기 과제에서는 DnC가 이전 방법들을 크게 능가했으며, 특히 변동성이 높은 설정에서 두드러진 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.