Skip to main content
QUICK REVIEW

[논문 리뷰] Lyapunov Design for Robust and Efficient Robotic Reinforcement Learning

Tyler Westenbroek, Fernando Castañeda|arXiv (Cornell University)|2022. 08. 13.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 제어 리아프노프 함수(CLFs)를 강화학습(RL) 목적함수에 통합하여 로봇 분야에서 데이터 효율적이고 견고한 안정화 제어기 학습을 가능하게 하는 리아프노프 기반 비용 형상화 방법을 제안한다. 표준 비용 함수에 CLF 기반 항을 추가함으로써, 최적화되지 않은 정책조차도 시스템을 안정화하도록 보장하여 RL 알고리즘이 수천 분의 일 수준의 데이터로도 안정화 제어기를 수렴할 수 있도록 한다. 이는 카트폴과 A1 4족보행로봇에서 각각 10초와 5분의 실제 환경 미세조정 데이터로 검증되었다.

ABSTRACT

Recent advances in the reinforcement learning (RL) literature have enabled roboticists to automatically train complex policies in simulated environments. However, due to the poor sample complexity of these methods, solving RL problems using real-world data remains a challenging problem. This paper introduces a novel cost-shaping method which aims to reduce the number of samples needed to learn a stabilizing controller. The method adds a term involving a Control Lyapunov Function (CLF) -- an `energy-like' function from the model-based control literature -- to typical cost formulations. Theoretical results demonstrate the new costs lead to stabilizing controllers when smaller discount factors are used, which is well-known to reduce sample complexity. Moreover, the addition of the CLF term `robustifies' the search for a stabilizing controller by ensuring that even highly sub-optimal polices will stabilize the system. We demonstrate our approach with two hardware examples where we learn stabilizing controllers for a cartpole and an A1 quadruped with only seconds and a few minutes of fine-tuning data, respectively. Furthermore, simulation benchmark studies show that obtaining stabilizing policies by optimizing our proposed costs requires orders of magnitude less data compared to standard cost designs.

연구 동기 및 목표

  • 실제 로봇 제어에서 강화학습의 열악한 샘플 복잡도 문제를 해결하기 위해, 특히 복잡한 시스템의 안정화를 위한 것이다.
  • 학습 목표에 시스템의 구조를 통합하여 안정화 제어기를 학습하기 위해 필요한 실제 환경 샘플 수를 줄이기 위해이다.
  • CLF 감독을 통해 최적화되지 않은 정책조차도 시스템을 안정화하도록 보장함으로써 RL 정책 탐색의 견고성을 향상시키기 위해이다.
  • 작은 양의 실제 환경 데이터로 시뮬레이션 기반 제어기를 효율적으로 미세조정할 수 있도록 하기 위해이다.
  • 학습되거나 근사된 CLF를 통해 CLF 기반 제어 설계의 적용 범위를 불확실하고 실제 환경 시스템으로 확장하기 위해이다.

제안 방법

  • 제어 리아프노프 함수(CLF) 기반 항을 추가한 수정된 비용 함수를 도입하여, 시간이 지남에 따라 CLF 값을 감소시키는 정책을 유도한다.
  • 진정한 CLF가 알려져 있지 않은 경우에도 간단하거나 학습된 동역학 모델에서 유도된 근사 CLF를 사용하여 RL 최적화를 안내한다.
  • 소프트 액터-크리틱(SAC) 알고리즘을 사용하고 보상 함수를 재형상화함: $ r_k = -[W(F(x_k,u_k)) - W(x_k)] - \|x_k\|_2^2 - 0.1\|u_k\|_2^2 $, 여기서 $ W $ 는 근사 CLF이다.
  • 사전에 학습된 시뮬레이션 기반 RL 정책의 가치 함수를 실제 환경에서의 미세조정을 위한 근사 CLF로 활용한다.
  • 이론적 분석에 따르면 CLF 항이 존재할 경우 작은 $ \gamma $ 가 안정화에 효과적이므로, RL에서 작은 할인 인자($ \gamma $)를 사용하여 학습 속도를 가속화한다.
  • 할인 인자를 변형하여 안정화 정책을 도출할 수 있는 가장 작은 $ \gamma $ 를 식별하기 위해 초모수 스윕을 수행하여 데이터 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1CLF 기반 비용 형상화 기법이 안정화 제어기를 학습하기 위해 필요한 실제 환경 샘플 수를 크게 줄일 수 있는가?
  • RQ2RL 목표에 CLF 항을 통합함으로써 정책 탐색의 견고성이 향상되어, 매우 최적화되지 않은 정책조차도 시스템을 안정화하는가?
  • RQ3시뮬레이션 기반 RL 정책의 가치 함수가 실제 하드웨어에서의 미세조정을 위한 타당한 근사 CLF로 기능할 수 있는가?
  • RQ4근사 CLF의 품질이 RL 알고리즘의 데이터 효율성과 수렴 속도에 어떤 영향을 미치는가?
  • RQ5표준 RL 관행과는 달리, CLF 감독이 존재할 경우 작은 할인 인자를 안정화에 효과적으로 사용할 수 있는가?

주요 결과

  • 제안된 방법은 실제 환경 데이터 10초만으로 Quanser 카트폴에 대해 안정화 제어기를 학습하였으며, 시뮬레이션에서 120만 단계가 필요한 기준선과 비교해 유사한 성능을 달성하였다.
  • Unitree A1 4족보행로봇의 경우, 단 5분의 실제 환경 데이터로 안정화 제어기를 학습하였으며, 단순 선형화 모델에서 수작업으로 설계한 CLF를 사용하였다.
  • 역퍼널 실험에서 입력 제약 조건이 엄격한 경우($|u| \leq 4$), CLF 보완 비용 덕분에 안정화를 달성하기 위한 학습 반복 수가 389회에서 198회로 감소하여 샘플 수가 48% 감소하였다.
  • 입력 제약 조건이 덜 엄격한 경우($|u| \leq 20$), 기준선 대비 92회에서 5회로 감소하여 필요한 샘플 수가 94.6% 감소하였다.
  • 안정화 정책를 도출할 수 있었던 가장 작은 할인 인자가 가장 빠른 학습 속도를 보였으며, 이는 CLF 감독이 존재할 경우 작은 $ \gamma $ 가 실제로 유용함을 확인하였다.
  • 근사 CLF가 진정한 전역 CLF가 아니었더라도 방법은 여전히 안정화를 보장하였으며, 이는 모델 정확도 부족에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.