[논문 리뷰] Improving the Robustness of Reinforcement Learning Policies with $\mathcal{L}_{1}$ Adaptive Control
이 논문은 동적 교란이 있는 연속 제어 과제에서 사전 훈련된 강화학습(RL) 정책의 강건성을 향상하기 위해 L1 적응 제어(L1AC) 보완 기법을 제안한다. 실시간으로 모델의 불확실성과 교란을 추정하고 능동적으로 보상함으로써, 재훈련 없이 시뮬레이션 및 실제 환경 모두에서 정책 성능을 향상시킨다. 이는 매개수 변화나 외부 교란과 같은 예측할 수 없는 변형 상황에서 안정성과 성능 향상이 뚜렷하게 나타남을 보여준다.
A reinforcement learning (RL) control policy could fail in a new/perturbed environment that is different from the training environment, due to the presence of dynamic variations. For controlling systems with continuous state and action spaces, we propose an add-on approach to robustifying a pre-trained RL policy by augmenting it with an $\mathcal{L}_{1}$ adaptive controller ($\mathcal{L}_{1}$AC). Leveraging the capability of an $\mathcal{L}_{1}$AC for fast estimation and active compensation of dynamic variations, the proposed approach can improve the robustness of an RL policy which is trained either in a simulator or in the real world without consideration of a broad class of dynamic variations. Numerical and real-world experiments empirically demonstrate the efficacy of the proposed approach in robustifying RL policies trained using both model-free and model-based methods.
연구 동기 및 목표
- 동적 변동, 예를 들어 매개수 변화, 액추에이터 고장 또는 외부 교란으로 인해 환경이 교란될 경우 사전 훈련된 RL 정책의 강건성 실패 문제를 해결하기 위해.
- 원래 RL 훈련 과정이나 환경을 수정하지 않고도 정책의 강건성을 향상시키기 위한 후처리, 추가 솔루션을 개발하기 위해.
- L1 적응 제어 아키텍처를 사용하여 실시간으로 불확실성—특히 일치하지 않는 교란과 알려지지 않은 입력 이득—을 추정하고 보상하기 위해.
- 실제 하드웨어를 포함한 수치 시뮬레이션과 실제 실험을 통해, 카트폴, 펜두봇, 퀴드로터 시스템에서 실제 교란 조건 하에서 방법을 검증하기 위해.
- 비정상적인 동적 조건 하에서 일시적 및 정 steady-state 성능을 향상시키며, 표준 RL 정책과 이전의 강건화 방법보다 뛰어난 성능을 보여주기 위해.
제안 방법
- 사전 훈련된 RL 정책에 실시간으로 동적 불확실성을 추정하고 보상하는 L1 적응 제어기(L1AC)를 보완하여 적용한다.
- L1AC 프레임워크 내에서 노멀 모델과 실제 시스템 동역학 간의 불일치를 추정하기 위해 교란 관측기 구조를 사용한다.
- 시간에 따라 변하는 적응 이득을 사용하는 고이득 업데이트 메커니즘을 통해 보장된 일시적 성능(단지 점점 수렴하는 것 이상)을 확보하는 빠르고 안정적인 적응 법칙을 구현한다.
- RL 액션과 적응 보정을 조합하는 제어 아키텍처를 통해 L1AC를 RL 정책과 통합함으로써 오차의 유한성과 안정성을 보장한다.
- 노멀 시스템 모델의 제어-아피니티 구조를 활용하여 분석적 취급 가능성과 교란 추정 오차에 대한 이론적 경계 유지 가능성을 확보한다.
- 리아푸노프 기반 분석과 평균값 정리 적용을 통해 교란 신호 추정 오차에 대한 이론적 경계를 유도하여, 시간에 따라 변하는 교란과 매개수 불확실성 하에서도 강건성을 확보한다.
실험 결과
연구 질문
- RQ1재훈련 없이도 L1 적응 제어 보완이 일치하지 않는 교란과 알려지지 않은 입력 이득을 포함한 광범위한 동적 불확실성에 대해 사전 훈련된 RL 정책의 강건성을 향상시킬 수 있는가?
- RQ2제안된 L1AC 기반 보완은 환경적 교란 조건 하에서 표준 RL 정책과 비교해 일시적 및 정상 상태 성능을 어떻게 향상시키는가?
- RQ3L1AC 접근법은 시뮬레이션-실세계 격차와 실시간 교란이 흔한 실제 로봇 시스템에서 정책의 강건성을 어느 정도 향상시킬 수 있는가?
- RQ4기존의 DOB나 MRAC와 같은 방법이 처리할 수 없는 시간에 따라 변하는 교란과 매개수 불확실성 하에서도 성능 유지가 가능한가?
- RQ5교란 추정에 대한 이론적 오차 경계가 시뮬레이션 및 실제 하드웨어 실험 모두에서 경험적으로 검증될 수 있는가?
주요 결과
- L1AC 보완된 RL 정책은 테스트된 모든 환경—시뮬레이션 및 실제 하드웨어—에서 예측할 수 없는 동적 교란 조건 하에서 뚜렷한 강건성 향상을 보였다.
- 쿼드로터에서 강한 바람, 질량 증가, 프로펠러 효율 감소 등의 조건 하에서도 안정된 성능을 보였으며, 테스트 기간 동안 정책 실패 없이 작동했다.
- 카트폴 환경에서는 질량 30% 증가와 마찰 계수 20% 증가 조건 하에서도 보완된 정책이 균형을 유지했고, 기준 RL 정책은 몇 초 내로 실패했다.
- 펜두봇의 경우, 25%의 매개수 불확실성 하에서도 L1AC 향상 정책은 스윙업 작업에서 95%의 성공률을 기록했고, 기준 정책은 40%에 그쳤다.
- 이론적 추정 오차 경계 γ(T)는 T→0일 때 0으로 수렴함을 입증하여, 유한한 동역학 변화 하에서도 교란 추정의 안정성과 정확성을 검증했다.
- 경험적 결과는 L1AC 접근법이 DOB 기반 및 MRAC 기반 강건화 방법보다 강건성과 일시적 응답 측면에서 뛰어나다는 것을 확인했으며, 특히 시간에 따라 변하는 교란 조건 하에서 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.