Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Input-Output Linearizing Controllers for Bipedal Robots via Reinforcement Learning

Fernando Castañeda, Mathias Wulfman|arXiv (Cornell University)|2020. 04. 15.
Robotic Locomotion and Control참고 문헌 19인용 수 6
한 줄 요약

이 논문은 모델 불확실성과 입력 포화 문제를 해결하기 위해 강화학습(RL)을 활용해 이원형 로봇의 입력-출력 선형 제어기를 향상시킨다. 학습된 보정 항을 추가하고 RL 학습 과정에 토크 제약 조건을 통합함으로써, RABBIT 로봇에서 심각한 모델 불일치와 포화 조건 하에서도 걷기 동작을 안정화시키며, 최소한의 토크 증가로 국소 지수 안정성을 확보하고, 훈련 분포 내에서 새로운 보행 패턴으로의 일반화를 가능하게 한다.

ABSTRACT

The main drawbacks of input-output linearizing controllers are the need for precise dynamics models and not being able to account for input constraints. Model uncertainty is common in almost every robotic application and input saturation is present in every real world system. In this paper, we address both challenges for the specific case of bipedal robot control by the use of reinforcement learning techniques. Taking the structure of a standard input-output linearizing controller, we use an additive learned term that compensates for model uncertainty. Moreover, by adding constraints to the learning problem we manage to boost the performance of the final controller when input limits are present. We demonstrate the effectiveness of the designed framework for different levels of uncertainty on the five-link planar walking robot RABBIT.

연구 동기 및 목표

  • 입력-출력 선형 제어기가 이원형 로봇에서 모델 불확실성에 민감하고 입력 포화를 처리할 수 없는 한계를 해결한다.
  • 실세계의 역학적 특성과 액추에이터 제약 조건 하에서도 강화학습을 기반으로 한 데이터 기반 프레임워크를 개발하여 내성적 안정성과 성능을 향상시킨다.
  • 부족한 제어도를 가진 하이브리드 시스템에 대해 강화학습을 하이브리드 제로 동역학(HZD) 프레임워크와 통합하여 장기적인 안정된 보행을 가능하게 한다.
  • 포incare 분석을 통해, 토크 포화 조건 하에서도 결과 제어기가 국소 지수 안정성을 확보할 수 있음을 보장한다.
  • 훈련 분포 내에서 미훈련된 보행 패턴에 대해서도 일반화가 가능한지를 검증한다.

제안 방법

  • Westenbroek 등(2019)의 RL 프레임워크를 하이브리드이고, 부족한 제어도를 가진 이원형 로봇 시스템에 HZD 방법을 적용해 확장한다.
  • DDPG 기반의 RL 에이전트를 사용하여 입력-출력 선형 제어기의 모델 불확실성 보정을 위한 추가 보정 항을 학습한다.
  • 액추에이터 제약 조건을 명시적으로 RL 목표 함수에 통합하여, 액추에이터 제한 조건 하에서도 성능 향상을 도모한다.
  • 훈련 중 시스템 안정성을 확보하기 위해 유한 시간 수렴 피드백 제어기를 설계하여, 제어도 부족 조건 하에서도 강건성을 확보한다.
  • 기준 경로의 베지에 계수를 바탕으로 출력 함수를 정의함으로써, 경로별 선형 제어를 가능하게 한다.
  • 정기적 보행 주기 근처의 선형화된 포incare 매핑의 고유값을 계산하여, 국소 지수 안정성을 검증하기 위해 포incare 분석을 적용한다.

실험 결과

연구 질문

  • RQ1강화학습이 이원형 로봇의 입력-출력 선형 제어기에서 모델 불확실성을 효과적으로 보정하는 데에 활용될 수 있는가?
  • RQ2RL 학습 과정에 입력 포화 제약 조건을 통합함으로써 실세계 시스템에서의 제어 성능 향상은 어떻게 이루어지는가?
  • RQ3원래 제어기가 실패하는 상황에서, RL을 통한 제어기가 고도의 모델-플랜트 불일치 조건 하에서도 보행을 안정화시킬 수 있는가?
  • RQ4훈련되지 않은 정기적 보행 패턴에 대해 얼마나 잘 일반화되는가?
  • RQ5포incare 분석을 통해 검증된 바와 같이, 토크 포화 조건 하에서도 RL을 통한 제어기가 국소 지수 안정성을 유지하는가?

주요 결과

  • RL을 통한 입력-출력 선형 제어기의 성능은 모델 불일치 비율 150% (스케일 = 3) 및 토크 포화 조건 하에서도 RABBIT 로봇의 보행을 성공적으로 안정화시키며, 원래 제어기는 몇 번의 단계 후에 실패한다.
  • 고도의 불확실성과 토크 포화 조건 하에서 선형화된 포incare 매핑의 주요 고유값은 0.83으로, 국소 지수 안정성을 확인한다.
  • 원래 IO 제어기와 유사한 토크 크기를 유지하며, 과도한 액추에이터 작동을 방지한다.
  • 훈련되지 않은 경로(예: 경로 2)에 대해서도 잘 일반화되어, 안정적인 장기 보행을 달성한다. 이는 훈련 경로와 유사한 경로에 대해 성능이 양호함을 의미한다.
  • 상당히 다른 경로(예: 경로 3)에서는 성능 저하가 발생함을 확인하여, 상태 분포 기반의 일반화 한계가 있음을 시사한다.
  • 훈련 과정이 성공적으로 수렴하기 위해서는 보행 단계의 상당 부분 동안 원래 IO 제어기가 기능을 유지해야 하는데, 이는 고도의 불확실성 조건에서의 핵심 제약 조건임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.