Skip to main content
QUICK REVIEW

[논문 리뷰] Ctrl-Z: Recovering from Instability in Reinforcement Learning

Vibhavari Dasagi, Jake Bruce|arXiv (Cornell University)|2019. 10. 09.
Reinforcement Learning in Robotics참고 문헌 36인용 수 13
한 줄 요약

이 논문은 깊이 강화학습의 안정성을 높이기 위해 주기적으로 통계적 가설 검정을 통해 정책 성능을 평가하고, 성능 향상이 멈추거나 악화될 경우 가장 성능이 좋았던 이전 정책 체크포인트로 되돌리는 모델에 종속되지 않는 방법인 Ctrl-Z를 제안한다. 이는 훈련의 안정성과 강건성을 크게 향상시키며, 6개 환경 중 5개에서 DDPG를 능가하고, 하이퍼파라미터 변형에 대해서도 TD3의 성능을 유지한다. 계산 오버헤드는 극히 적다.

ABSTRACT

When learning behavior, training data is often generated by the learner itself; this can result in unstable training dynamics, and this problem has particularly important applications in safety-sensitive real-world control tasks such as robotics. In this work, we propose a principled and model-agnostic approach to mitigate the issue of unstable learning dynamics by maintaining a history of a reinforcement learning agent over the course of training, and reverting to the parameters of a previous agent whenever performance significantly decreases. We develop techniques for evaluating this performance through statistical hypothesis testing of continued improvement, and evaluate them on a standard suite of challenging benchmark tasks involving continuous control of simulated robots. We show improvements over state-of-the-art reinforcement learning algorithms in performance and robustness to hyperparameters, outperforming DDPG in 5 out of 6 evaluation environments and showing no decrease in performance with TD3, which is known to be relatively stable. In this way, our approach takes an important step towards increasing data efficiency and stability in training for real-world robotic applications.

연구 동기 및 목표

  • 함수 근사 오류, 하이퍼파라미터 민감성 또는 나쁜 탐색으로 인해 자가 생성된 훈련 데이터가 악화될 수 있는 온라인 강화학습의 불안정성 문제를 해결하기 위해.
  • 정책 업데이트를 제약하지 않으면서도 성능 저하 복구가 가능한 모델에 종속되지 않고 계산 오버헤드가 낮은 메커니즘을 개발하기 위해.
  • 불안정한 학습이 비용과 위험을 증가시키는 실제 로봇 응용 분야에서 데이터 효율성과 안전성을 향상시키기 위해.
  • 특히 연속 제어 벤치마크에서 다양한 하이퍼파라미터 설정과 RL 알고리즘에 대해 메서드의 강건성을 평가하기 위해.

제안 방법

  • 현재 정책을 과거 체크포인트 기록과 통계적 가설 검정을 통해 평가하여 향상이 계속되고 있는지 평가한다.
  • 상태에 종속되지 않는 비모수적 가설 검정, 예를 들어 맨-위트니 U 검정을 사용하여 보상 분포를 비교하고 향상 지속 확률을 결정한다.
  • 향상 지속 확률이 사전 정의된 임계값 ρ 이하로 떨어지면 에이전트는 이전에 가장 우수한 성능을 보였던 정책 파라미터로 되돌아간다.
  • 이 방법은 모델 아키텍처, RL 알고리즘, 보상 척도와 무관하므로 광범위하게 적용 가능하다.
  • 정책 체크포인트 기록을 유지하기 위해 윈도우 기반 평가를 사용하여 치명적인 성능 저하로부터 복구할 수 있다.
  • 임계값 ρ는 경험적으로 튜닝되었으며, 다양한 값에 대해 강건함을 입증하여 하이퍼파라미터 선택에 대한 민감도를 감소시켰다.

실험 결과

연구 질문

  • RQ1정책 업데이트를 제약하지 않으면서도 원칙적이고 모델에 종속되지 않는 방법이 깊이 강화학습에서 성능 저하를 탐지하고 복구할 수 있는가?
  • RQ2제안된 방법이 하이퍼파라미터 변형 상황에서도 훈련 안정성과 강건성을 얼마나 효과적으로 향상시키는가?
  • RQ3DDPG와 같이 본질적으로 불안정한 알고리즘과 TD3와 같이 안정적인 알고리즘에 적용했을 때 성능이 유지되거나 향상되는가?
  • RQ4임계값 ρ의 선택에 얼마나 민감한가? 어떤 값의 범위에서 최적의 성능을 내는가?

주요 결과

  • Ctrl-Z는 표준 하이퍼파라미터 설정 하에서 연속 제어 벤치마크 환경 6개 중 5개에서 표준 DDPG를 능가하며, 상당한 성능 향상을 보였다.
  • 이미 안정적인 알고리즘인 TD3에 적용했을 때 Ctrl-Z는 성능 저하를 유발하지 않아, 잘 작동하는 알고리즘에 간섭하지 않는다는 것을 시사한다.
  • 하이퍼파라미터 변형에 대해 강건성을 보였으며, DDPG에 Ctrl-Z를 추가했을 때 모든 환경에서 성능 향상이 관찰되었다.
  • 가설 검정의 맨-위트니 변형이 성능 및 안정성 측면에서 다른 통계적 검정보다 항상 뛰어났다.
  • 임계값 ρ는 정밀한 값에 민감하지 않으며, 높은 성능을 보이는 넓은 값의 범위를 가지며, 튜닝 부담을 감소시켰다.
  • 이 방법은 극히 낮은 계산 오버헤드를 유발하여, 데이터 수집이 비용이 많이 드는 실제 로봇 응용 분야에서 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.