Skip to main content
QUICK REVIEW

[논문 리뷰] $H_\infty$ Model-free Reinforcement Learning with Robust Stability Guarantee

Minghao Han, Yuan Tian|arXiv (Cornell University)|2019. 11. 07.
Reinforcement Learning in Robotics참고 문헌 12인용 수 8
한 줄 요약

이 논문은 최대 엔트로피 목적함수를 사용하여 리아프노프 함수와 정책을 함께 학습함으로써 강건한 안정성과 $H_\infty$ 성능을 보장하는 모델 프리 강화학습 프레임워크인 Robust Lyapunov-based Actor-Critic (RLAC)을 제안한다. 이 방법은 큰 순간적인 외란과 매개변수 불확실성 하에서도 안정성을 확보하며, 특히 최대 제어 입력의 6배에 이르는 외란 복구 능력에서 최신 강화학습 및 전통적 제어 기준보다 뛰어나다.

ABSTRACT

Reinforcement learning is showing great potentials in robotics applications, including autonomous driving, robot manipulation and locomotion. However, with complex uncertainties in the real-world environment, it is difficult to guarantee the successful generalization and sim-to-real transfer of learned policies theoretically. In this paper, we introduce and extend the idea of robust stability and $H_\infty$ control to design policies with both stability and robustness guarantee. Specifically, a sample-based approach for analyzing the Lyapunov stability and performance robustness of a learning-based control system is proposed. Based on the theoretical results, a maximum entropy algorithm is developed for searching Lyapunov function and designing a policy with provable robust stability guarantee. Without any specific domain knowledge, our method can find a policy that is robust to various uncertainties and generalizes well to different test environments. In our experiments, we show that our method achieves better robustness to both large impulsive disturbances and parametric variations in the environment than the state-of-art results in both robust and generic RL, as well as classic control. Anonymous code is available to reproduce the experimental results at https://github.com/RobustStabilityGuaranteeRL/RobustStabilityGuaranteeRL.

연구 동기 및 목표

  • 실세계 로봇 응용 분야에 대한 모델 프리 강화학습에서 이론적 강건성과 안정성 보장을 위한 부족함을 보완하기 위해.
  • 시스템 모델이 필요 없이 샘플 기반으로 리아프노프 안정성과 $H_\infty$ 성능을 분석하기 위한 방법을 개발하기 위해.
  • 환경 내 큰 순간적 외란과 매개변수 불확실성에 대해 증명 가능한 강건성을 갖춘 정책을 설계하기 위해.
  • 도메인 특화 지식 없이도 예측할 수 없는 테스트 환경으로의 일반화를 가능하게 하기 위해.
  • 강건 제어 이론을 최대 엔트로피 프레임워크를 통해 딥 강화학습과 통합하여 안정성과 성능 보장을 확보하기 위해.

제안 방법

  • 폐쇄 루프 시스템에서의 경험 데이터를 활용하여 리아프노프 안정성과 $H_\infty$ 성능에 대한 새로운 샘플 기반 분석을 제안한다.
  • 최대 엔트로피 목적함수를 통해 리아프노프 함수와 확률적 정책을 동시에 최적화하는 RLAC 알고리즘을 개발한다.
  • 정책 최적화를 위해 소프트 액터-크리틱(SAC) 프레임워크를 활용하며, 별도의 신경망을 리아프노프 함수에 할당한다.
  • 리아프노프 함수가 정의상 양의 정부호이자 정책 동역학 하에서 기대값 감소를 보장하기 위해 제약 조건을 도입한다.
  • 최악의 외란 하에서도 비용 증가가 유한하게 유지되도록 보장하는 $H_\infty$ 제어를 통한 강건한 성능 기준을 도입한다.
  • 실제 학습을 가능하게 하기 위해 무한 시간 할인 비용과 외란 에너지를 시간-시간 기반 근사로 변환한다.

실험 결과

연구 질문

  • RQ1알려진 시스템 모델이 없이도 모델 프리 강화학습 방법이 리아프노프 안정성과 $H_\infty$ 강건성을 보장할 수 있는가?
  • RQ2최대 엔트로피를 통한 리아프노프 함수와 정책의 공동 학습이 큰 순간적 외란에 대한 강건성을 향상시킬 수 있는가?
  • RQ3환경 내 매개변수 불확실성 하에서 제안된 방법이 최신 강화학습 및 전통적 제어 기준보다 더 나은 일반화 성능을 보일 수 있는가?
  • RQ4학습된 리아프노프 함수의 포함이 표준 강화학습 알고리즘에 비해 안정성과 성능을 어떻게 향상시키는가?
  • RQ5모델이 없는 조건에서 샘플 효율성과 최신 기술 수준의 성능 유지를 유지하면서도 증명 가능한 강건성을 달성할 수 있는가?

주요 결과

  • RLAC 에이전트는 최대 제어 입력의 4~6배에 이르는 순간적 외란에서도 성공적으로 복구했으며, 모든 기준 기반 방법은 거의 확실히 실패했다.
  • 큰 순간적 외란 하에서 RLAC의 사망률은 모든 기준보다 유의미하게 낮아, 뛰어난 내구성을 입증했다.
  • 매개변수 불확실성 평가에서 RLAC는 모든 기준보다 질량 및 구조적 값의 다양한 조합에서 더 나은 일반화 성능를 보였다.
  • RLAC가 학습한 정책은 예측할 수 없는 매개변수 변화가 있는 다양한 테스트 환경에서도 낮은 총 비용과 높은 안정성을 유지했다.
  • 리아프노프 함수와 정책의 공동 최적화를 통해 사전 도메인 지식이나 모델 가정 없이도 안정적이고 강건한 정책을 도출했다.
  • 모든 알고리즘이 학습 과정에서 유사한 최종 성능에 도달했지만, RLAC만이 극단적인 외란과 불확실성에 대한 강건성을 유일하게 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.