Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Domain Randomised Reinforcement Learning through Peer-to-Peer Distillation

Chenyang Zhao, Timothy M. Hospedales|arXiv (Cornell University)|2020. 12. 09.
Reinforcement Learning in Robotics참고 문헌 28인용 수 5
한 줄 요약

이 논문은 다수의 강화학습 에이전트가 서로 다른 랜덤라이제이션된 환경에서 국지적으로 학습하고, KL 발산 기반 상호 정규화를 통해 지식을 공유하는 온라인 디스틸레이션 프레임워크인 피어 투 피어 디스틸레이션 강화학습(P2PDRL)을 제안한다. P2PDRL은 글로벌 정책이 필요로 하지 않으며 추가적인 추론 비용 없이도 다양한 도메인에서 중심집중형 디스틸레이션 및 기준 방법에 비해 뛰어난 강건성과 일반화 성능을 달성한다.

ABSTRACT

In reinforcement learning, domain randomisation is an increasingly popular technique for learning more general policies that are robust to domain-shifts at deployment. However, naively aggregating information from randomised domains may lead to high variance in gradient estimation and unstable learning process. To address this issue, we present a peer-to-peer online distillation strategy for RL termed P2PDRL, where multiple workers are each assigned to a different environment, and exchange knowledge through mutual regularisation based on Kullback-Leibler divergence. Our experiments on continuous control tasks show that P2PDRL enables robust learning across a wider randomisation distribution than baselines, and more robust generalisation to new environments at testing.

연구 동기 및 목표

  • 너무 넓은 랜덤라이제이션 분포로 인해 도메인 랜덤라이제이션된 강화학습에서 높은 변동성과 불안정성이 발생하는 문제를 해결하기 위해.
  • 중앙집중형 디스틸레이션 없이도 에이전트 간의 지식 공유를 통해 새로운 환경으로의 제로샷 일반화를 향상시키기 위해.
  • 상호 정규화를 통해 정책의 강건성을 향상시키는 탈중앙화된 온라인 디스틸레이션 메커니즘을 개발하기 위해.
  • 피어 투 피어 디스틸레이션이 중심집중형 디스틸레이션 및 표준 PPO보다 샘플 효율성과 일반화 능력에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • P2PDRL은 환경의 동역학 또는 관측 파라미터에 대해 서로 다른 랜덤라이제이션을 적용한 K개의 병렬 강화학습 에이전트를 사용한다.
  • 각 에이전트는 정책 향상을 위한 표준 PPO 손실과 행동 분포 간 기대값에 기반한 Kullback–Leibler(KL) 발산을 이용한 피어 투 피어 디스틸레이션 손실을 최적화한다.
  • 디스틸레이션 손실은 에이전트들이 동료의 예측과 일치하도록 유도하여 중앙 정책이 없이도 지식 이행을 가능하게 한다.
  • 이 방법은 온라인 방식으로 작동하며, 각 에이전트는 국소 경험과 상호 정규화만을 사용하여 정책을 업데이트한다.
  • 글로벌 정책을 훈련시킬 필요가 없기 때문에 중심집중형 디스틸레이션의 계산 오버헤드를 피할 수 있다.
  • 고정된 훈련 랜덤라이제이션 강도(ε^tr=0.2)를 사용하여 연속 제어 과제에서 평가하였으며, 일반화 능력은 다양한 테스트 도메인 다양성(ε^te) 조건에서 테스트하였다.

실험 결과

연구 질문

  • RQ1피어 투 피어 디스틸레이션은 도메인 랜덤라이제이션된 강화학습에서 샘플 효율성과 학습 안정성을 향상시킬 수 있는가?
  • RQ2온라인 탈중앙화 디스틸레이션은 중심집중형 디스틸레이션 또는 표준 PPO보다 새로운 환경으로의 일반화 성능을 더 높일 수 있는가?
  • RQ3P2PDRL의 성능는 훈련 도메인 분포의 다양성이 증가함에 따라 어떻게 스케일링되는가?
  • RQ4에이전트 예측 간 KL 발산을 통한 상호 정규화가 도메인 이동에 대한 강건성을 향상시킬 수 있는가?

주요 결과

  • P2PDRL은 워커, 앤티, 휴먼로이드, 허퍼, 할프체타 등 5개의 연속 제어 과제에서 바닐라 PPO 및 DnC보다 더 높은 점차적 성능를 달성한다.
  • 특히 앤티와 할프체타에서 기준 방법에 비해 더 빠른 수렴을 보이며, 학습 곡선상에서 더 효율적인 샘플 사용을 확인할 수 있다.
  • ε^te에 따라 변화하는 도메인 이동 수준에서 새로운 테스트 환경으로의 일반화 능력이 뚜렷이 향상되어, PPO 및 DnC보다 이전 성능에서 뛰어나다.
  • ε^tr가 0.5까지 증가하는 높은 훈련 도메인 다양성 조건에서도 P2PDRL의 테스트 리워드는 안정적으로 유지되며, PPO는 ε^tr=0.5를 초과하면 성능이 급격히 악화된다.
  • 중앙집중형 디스틸레이션 단계가 필요로 하지 않기 때문에 계산 비용을 줄이며 동시에 강건성을 향상시킨다.
  • 특히 높은 도메인 이동 조건에서 학습 효율성과 제로샷 일반화 능력에서 일관된 향상이 관찰된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.