Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Policy Distillation

Kwei-Herng Lai, Daochen Zha|arXiv (Cornell University)|2020. 06. 07.
Reinforcement Learning in Robotics참고 문헌 29인용 수 10
한 줄 요약

이 논문은 사전에 트레이닝된 트레이너가 필요 없이, 동일한 환경에서 동시에 훈련되는 두 에이전트가 상호 지식 정제를 통해 성능을 향상시키는 학생-학습자 강화학습 프레임워크인 이중 정책 정제(Dual Policy Distillation, DPD)를 소개한다. 이 방법은 '불리한 상태'에서 열악한 행동으로부터의 정제 전략을 사용하여, 함수 근사와 함께 연속 제어 과제에서 이론적 정책 향상과 실증적 성과 향상을 이룬다.

ABSTRACT

Policy distillation, which transfers a teacher policy to a student policy has achieved great success in challenging tasks of deep reinforcement learning. This teacher-student framework requires a well-trained teacher model which is computationally expensive. Moreover, the performance of the student model could be limited by the teacher model if the teacher model is not optimal. In the light of collaborative learning, we study the feasibility of involving joint intellectual efforts from diverse perspectives of student models. In this work, we introduce dual policy distillation(DPD), a student-student framework in which two learners operate on the same environment to explore different perspectives of the environment and extract knowledge from each other to enhance their learning. The key challenge in developing this dual learning framework is to identify the beneficial knowledge from the peer learner for contemporary learning-based reinforcement learning algorithms, since it is unclear whether the knowledge distilled from an imperfect and noisy peer learner would be helpful. To address the challenge, we theoretically justify that distilling knowledge from a peer learner will lead to policy improvement and propose a disadvantageous distillation strategy based on the theoretical results. The conducted experiments on several continuous control tasks show that the proposed framework achieves superior performance with a learning-based agent and function approximation without the use of expensive teacher models.

연구 동기 및 목표

  • 딥 강화학습에서 트레이너-학습자 정제의 높은 계산 비용과 성능 한계를 해결하기 위해.
  • 불완전한 동료 정책이 학생-학습자 프레임워크에서 상호 학습을 위해 유용한 지식을 제공할 수 있는지 탐색하기 위해.
  • 오직 학생 에이전트만을 사용하여 정책 성능을 향상시키는 이론적으로 탄탄하고 실용적인 정제 전략을 개발하기 위해.
  • 전문가 지시나 고비용 트레이너 모델에 의존하지 않고도 연속 제어 과제에서 더 빠르고 샘플 효율적인 학습을 가능하게 하기 위해.

제안 방법

  • 두 학생 정책가 동일한 환경에서 서로 다른 무작위 초기화로 동시에 훈련된다.
  • 각 정책는 자체 강화학습 목표를 최적화하면서도, 동료 정책의 행동을 모방하도록 유도하는 정제 손실을 최소화한다.
  • 불리한 정제 전략이 제안되며, 이는 동료 정책가 성능이 열악한 상태(즉, '불리한 상태')에서 정제를 우선시한다.
  • 정제 목표는 동료 정책의 고손실 영역에서의 열악한 행동에서 배우며, 각 정책가 최적의 정책에 수렴하도록 설계된다.
  • 이론적 분석을 통해 두 에이전트를 조합한 가상의 하이브리드 정책에서 정제하면 이상 조건 하에 정책 향상이 보장됨을 입증한다.
  • 프레임워크는 기본 강화학습 알고리즘으로 DDPG를 사용하고, 함수 근사를 사용한 연속 제어 벤치마크에서 검증된다.

실험 결과

연구 질문

  • RQ1교수 모델 없이 두 불완전한 학생 정책가 상호 지식 정제를 통해 상호 향상시킬 수 있는가?
  • RQ2노이즈가 많은 동료 정책에서 정제를 하더라도, 동료 정책가 열악할지라도 정책 향상이 이루어지는가?
  • RQ3'불리한 상태'에 집중하는 불리한 정제 전략이 학습 효율성과 최종 성능을 향상시키는가?
  • RQ4이중 정제 프레임워크는 표준 DDPG 및 트레이너-학습자 정제에 비해 샘플 효율성과 최종 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 DPD 프레임워크는 어떤 트레이너 모델도 사용하지 않고도 표준 DDPG에 비해 연속 제어 과제에서 학습 속도와 최종 성능을 크게 향상시킨다.
  • 모든 훈련 단계에서 DPD 에이전트의 Q-값은 DDPG보다 더 빨리 증가하고 더 높은 값을 도달하여, 개선된 가치 추정을 나타낸다.
  • 두 DPD 에이전트 간 행동 간 평균 유클리드 거리는 초기 훈련 시 0.43에서 후기 단계에선 0.31로 감소하여 정책의 수렴과 일치를 보여준다.
  • 실증 결과는 두 DPD 에이전트가 환경의 서로 다른 측면을 탐색하고 상호 보완적인 행동을 보이며, 유용한 지식 전이의 가설을 뒷받침한다.
  • 불리한 정제 전략은 고손실 영역에서의 열악한 행동에서 배우는 것을 효과적으로 우선시하여 일관된 정책 향상을 이룬다.
  • 이론적 분석을 통해 두 에이전트가 조합된 가상의 하이브리드 정책에서 정제하면 이상 조건 하에 정책 향상이 보장됨을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.