Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization in Transfer Learning

Suzan Ece Ada, Emre Uğur|arXiv (Cornell University)|2019. 09. 03.
Reinforcement Learning in Robotics참고 문헌 36인용 수 5
한 줄 요약

이 논문은 연속 제어를 위한 전이 강화 학습에서 일반화를 향상시키기 위해 엄격한 클리핑, 조기 정지, 최대 엔트로피 적대적 학습이라는 정규화 기법을 제안한다. 학습 반복 횟수를 하이퍼파rameter로 간주하고 정책 스냅샷을 활용함으로써, 다양한 형태와 환경 역학적 특성에서 뛰어난 전이 성능를 달성하며, 이는 이전 연구를 초월하는 일반화 범위를 확장한다.

ABSTRACT

Agents trained with deep reinforcement learning algorithms are capable of performing highly complex tasks including locomotion in continuous environments. We investigate transferring the learning acquired in one task to a set of previously unseen tasks. Generalization and overfitting in deep reinforcement learning are not commonly addressed in current transfer learning research. Conducting a comparative analysis without an intermediate regularization step results in underperforming benchmarks and inaccurate algorithm comparisons due to rudimentary assessments. In this study, we propose regularization techniques in deep reinforcement learning for continuous control through the application of sample elimination, early stopping and maximum entropy regularized adversarial learning. First, the importance of the inclusion of training iteration number to the hyperparameters in deep transfer reinforcement learning will be discussed. Because source task performance is not indicative of the generalization capacity of the algorithm, we start by acknowledging the training iteration number as a hyperparameter. In line with this, we introduce an additional step of resorting to earlier snapshots of policy parameters to prevent overfitting to the source task. Then, to generate robust policies, we discard the samples that lead to overfitting via a method we call strict clipping. Furthermore, we increase the generalization capacity in widely used transfer learning benchmarks by using maximum entropy regularization, different critic methods, and curriculum learning in an adversarial setup. Subsequently, we propose maximum entropy adversarial reinforcement learning to increase the domain randomization. Finally, we evaluate the robustness of these methods on simulated robots in target environments where the morphology of the robot, gravity, and tangential friction coefficient of the environment are altered.

연구 동기 및 목표

  • 딥 강화 학습 전이 학습에서의 일반화 부족과 과적합 문제를 해결하기 위해.
  • 원천 작업 성능이 목표 작업의 일반화 능력에 대한 지표로 신뢰할 수 없다는 것을 입증하기 위해.
  • 학습 반복 횟수를 하이퍼파rameter로 간주함으로써 전이 학습의 강인성을 향상시키기 위해.
  • 형태와 역학적 특성이 변경된 미지의 작업으로 정책 전이를 향상시키는 정규화 기법을 개발하기 위해.
  • 기존 방법을 초월하여 전이 학습 벤치마크의 일반화 범위를 확장하기 위해.

제안 방법

  • 과적합을 유도하는 샘플을 제거하기 위해 PPO 클리핑 파라미터를 매우 작은 값으로 줄이는 엄격한 클리핑 PPO(Strict Clipping PPO, SC-PPO)를 도입한다.
  • 과적합을 방지하기 위해 더 이른 정책 스냅샷을 선택하는 조기 정지 기법을 적용한다.
  • 탐색과 강인성을 향상시키기 위해 적대적 RL 환경에서 최대 엔트로피 정규화를 적용한다.
  • 도메인 랜덤라이제이션 환경에서 적대적 정책 학습을 향상시키기 위해 커리큘럼 학습과 엔트로피 보너스를 활용한다.
  • SC-PPO, 조기 정지, 엔트로피 정규화된 적대적 학습을 조합하여 도전적인 목표 작업에서 일반화 능력을 향상시킨다.
  • 더 나은 일반화 선택을 위해 학습 반복 동안 여러 정책 스냅샷을 저장하고 평가하는 정책 버퍼를 유지한다.

실험 결과

연구 질문

  • RQ1원천 작업 성능이 전이 강화 학습에서 일반화 능력을 신뢰성 있게 예측할 수 있는가?
  • RQ2학습 반복 횟수를 하이퍼파rameter로 간주하는 것이 전이 학습 성능 향상에 기여하는가?
  • RQ3엄격한 클리핑과 조기 정지는 원천 작업에 대한 과적합을 줄이는 데 얼마나 효과적인가?
  • RQ4엔트로피 정규화된 적대적 학습은 형태와 역학적 특성이 다양한 목표 작업에서 일반화 능력을 얼마나 향상시키는가?
  • RQ5정규화 기법의 조합이 기존 벤치마크를 초월하여 전이 학습의 일반화 범위를 확장할 수 있는가?

주요 결과

  • SC-PPO와 조기 정지는 고차원 히우먼로이드 환경에서도 원천 작업에 대한 과적합을 방지함으로써 목표 작업 성능을 크게 향상시킨다.
  • Hopper 형태 작업의 일반화 범위를 RARL 대비 [2.5, 4.75]에서 [1, 6]으로 확장한다.
  • 중력 변화에 대해서는 [0.5G, 1.75G] 범위 내에서 목표 작업에서 전진 이동을 가능하게 하며, 기준 방법을 능가한다.
  • 엔트로피 정규화된 적대적 학습은 고마찰(3.5×) 및 고중력(1.75G) 환경에서 성능을 향상시킨다.
  • 정책 버퍼와 반복 기반 하이퍼파rameter 선택을 통해 미지의 목표 작업에서 더 높은 점프스타트 성능를 달성한다.
  • SC-PPO, 조기 정지, 엔트로피 정규화의 조합은 원천 작업에서 추출 가능한 일반화 가능한 정책의 수를 증가시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.