Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning with Robust and Smooth Policy

Qianli Shen, Yan Li|arXiv (Cornell University)|2020. 03. 21.
Reinforcement Learning in Robotics참고 문헌 29인용 수 16
한 줄 요약

이 논문은 소수의 입력 변화에 따른 출력 변화를 억제함으로써 딥 강화학습 정책의 스무딩을 강제하는 새로운 정규화 프레임워크 SR²L을 제안한다. TRPO와 DDPG에 스무딩 정규화를 통합함으로써, 추가적인 적대적 훈련이 필요 없이 샘플 효율성, 훈련 안정성, 상태공간 노이즈 및 적대적 외란에 대한 강건성을 향상시킨다.

ABSTRACT

Deep reinforcement learning (RL) has achieved great empirical successes in various domains. However, the large search space of neural networks requires a large amount of data, which makes the current RL algorithms not sample efficient. Motivated by the fact that many environments with continuous state space have smooth transitions, we propose to learn a smooth policy that behaves smoothly with respect to states. We develop a new framework -- extbf{S}mooth extbf{R}egularized extbf{R}einforcement extbf{L}earning ($ extbf{SR}^2 extbf{L}$), where the policy is trained with smoothness-inducing regularization. Such regularization effectively constrains the search space, and enforces smoothness in the learned policy. Moreover, our proposed framework can also improve the robustness of policy against measurement error in the state space, and can be naturally extended to distribubutionally robust setting. We apply the proposed framework to both on-policy (TRPO) and off-policy algorithm (DDPG). Through extensive experiments, we demonstrate that our method achieves improved sample efficiency and robustness.

연구 동기 및 목표

  • 신경망의 고차원적이고 복잡한 탐색 공간으로 인해 발생하는 딥 RL의 열악한 샘플 효율성과 불안정성 문제를 해결하기 위해.
  • 실제 환경에서 흔히 발생하는 상태 측정 오차와 적대적 외란에 대한 정책의 강건성을 향상시키기 위해.
  • 성능 저하 없이 도메인 특화 사전 지식이 필요 없는 탄력적인 정규화 프레임워크를 개발하기 위해.
  • 스무딩 정규화가 온-폴리시 및 오프-폴리시 강화학습 알고리즘에서 샘플 효율성과 강건성을 자연스럽게 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 국소 리프시츠 감도를 기반으로, 상태 입력의 미소 변화에 따른 정책 출력의 큰 변화를 억제하는 스무딩 유도 정규화 항을 도입한다.
  • TRPO(온-폴리시)에서는 정책 네트워크에 직접 정규화를 적용하고, DDPG(오프-폴리시)에서는 정책 또는 Q함수에 적용하여 스무딩을 강제한다.
  • 강건 통계에서 유래한 국소 이동 감도 측정치를 정책의 스무딩 정도의 대체 측정치로 사용하여, 정책 네트워크의 탐색 공간을 효과적으로 제약한다.
  • 평가 중에 투영된 기울기 상승 방법을 사용하여 적대적 외부를 생성함으로써, 상태 외란 상황에서의 강건성을 테스트한다.
  • 기존 훈련 파이프라인에 즉각 통합 가능한 표준 RL 알고리즘과 호환되는 정규화를 설계한다.
  • 스무딩이 유도하는 강건성을 활용하여, 분포 기반 강건성 설정으로 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1정책 네트워크에서 스무딩을 강제하면 딥 강화학습의 샘플 효율성이 향상되는가?
  • RQ2스무딩 정규화는 연속 제어 과제에서 랜덤 및 적대적 상태 외란에 대해 강건성을 향상시키는가?
  • RQ3제안된 정규화는 온-폴리시(TRPO)와 오프-폴리시(DDPG) 딥 RL 알고리즘 양쪽에 효과적으로 적용될 수 있는가?
  • RQ4스무딩 정규화는 다양한 랜덤 시드에서 안정적인 훈련과 더 나은 최악의 성능을 이끌어내는가?
  • RQ5적대적 예제에 대해 명시적으로 훈련하지 않아도 스무딩 정규화가 강건성의 대체 지표로 기능하는가?

주요 결과

  • MuJoCo 환경에서 TRPO-SR과 DDPG-SR은 모든 보상 백분위수에서 기준 모델을 균일하게 능가하여 최악의 성능과 최고 성능 모두 향상됨을 보여준다.
  • TRPO-SR은 스위머와 허프체타에서 최악의 성능이 유의미하게 향상되었고, 동시에 경쟁 수준의 최고 성능도 유지하여 초기화 변동성에 대한 강건성을 입증한다.
  • 증가하는 상태 외란(랜덤 및 적대적 모두) 상황에서 TRPO-SR의 누적 보상은 TRPO보다 더 느리게 감소함을 보이며, 더 높은 강건성을 입증한다.
  • DDPG-SR-A와 DDPG-SR-C는 큰 외란 수준에서 유사한 강건성과 안정성 향상을 보이며, 변동성이 감소함을 확인하였다.
  • 스무딩 정규화는 환경 단위 수를 기준으로 목표 성능에 도달하는 데 필요한 단계 수를 기준으로 약 30-50%의 샘플 효율성 향상을 이끌어냈다.
  • 추가적인 적대적 훈련 없이도 강건성을 향상시켰으며, 이는 스무딩이 상태공간 외란에 대해 암묵적인 정규화 역할을 함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.