[논문 리뷰] Feedback Linearization for Unknown Systems via Reinforcement Learning
이 논문은 알려지지 않은 비선형 시스템을 위한 피드백 선형화 제어기를 학습하기 위해 모델 프리 강화 학습 접근법을 제안한다. 이는 명목상의 모델 기반 제어기와 학습된 약선형 보정항을 결합함으로써 이루어지며, 연속시간 최적화 및 정책 그래디언트 방법을 사용하여 볼록성과 진짜 선형화 제어기로의 수렴을 보장한다. 이 프레임워크는 실수로 구현된 시뮬레이션 및 실제 로봇 시스템에서 실용적인 데이터 효율성으로 향상된 추적 성능을 보여준다.
We present a novel approach to control design for nonlinear systems which leverages model-free policy optimization techniques to learn a linearizing controller for a physical plant with unknown dynamics. Feedback linearization is a technique from nonlinear control which renders the input-output dynamics of a nonlinear plant \emph{linear} under application of an appropriate feedback controller. Once a linearizing controller has been constructed, desired output trajectories for the nonlinear plant can be tracked using a variety of linear control techniques. However, the calculation of a linearizing controller requires a precise dynamics model for the system. As a result, model-based approaches for learning exact linearizing controllers generally require a simple, highly structured model of the system with easily identifiable parameters. In contrast, the model-free approach presented in this paper is able to approximate the linearizing controller for the plant using general function approximation architectures. Specifically, we formulate a continuous-time optimization problem over the parameters of a learned linearizing controller whose optima are the set of parameters which best linearize the plant. We derive conditions under which the learning problem is (strongly) convex and provide guarantees which ensure the true linearizing controller for the plant is recovered. We then discuss how model-free policy optimization algorithms can be used to solve a discrete-time approximation to the problem using data collected from the real-world plant. The utility of the framework is demonstrated in simulation and on a real-world robotic platform.
연구 동기 및 목표
- 정확한 동역학 모델이 없거나 모델링하기 어려운 비선형 시스템에 대해 피드백 선형화 제어기를 설계하는 데 도전하는 것.
- 정확한 시스템 모델가 필요하고 모델링 오차에 민감한 모델 기반 피드백 선형화의 한계를 극복하는 것.
- 함수 근사와 정책 최적화를 활용해 시스템 데이터로부터 직접 선형화 제어기를 학습하는 데이터 효율적인 모델 프리 방법을 개발하는 것.
- 약간의 구조적 가정 하에 진짜 선형화 제어기로의 볼록성과 수렴에 대한 이론적 보장을 제공하는 것.
- 최소한의 사전 모델 지식으로도 실용적인 적용 가능성을 시뮬레이션 및 실제 로봇 실험을 통해 입증하는 것.
제안 방법
- 명목상의 모델 기반 선형화 제어기에서 시작하여 신경망으로 파arameter화된 학습된 약선형 보정항을 추가한다.
- 실제 선형화된 동역학과 목표 동역학 간의 오차를 최소화하기 위해 연속시간 최적화 문제를 설정하며, 손실 함수는 출력 궤적의 제곱 편차로 정의된다.
- 학습된 구성요소에 사용된 기저 함수들의 선형 독립성 보장 조건 하에서 최적화 문제가 (강하게) 볼록임을 보여준다.
- 이 볼록성 조건은 적응 제어 이론에서의 지속적인 자극 개념과 연결되어 있으며, 유일하고 안정적인 학습을 보장한다.
- 최적화 문제의 이산시간 근사치는 PPO와 같은 표준 정책 최적화 알고리즘을 사용해 실세계 롤아웃 데이터를 기반으로 학습함으로써 해결된다.
- 이 프레임워크는 임의의 함수 근사(예: 신경망)를 허용하며, 기존 적응 제어 방법과 달리 학습 중에 특이성 문제가 발생하지 않는다.
실험 결과
연구 질문
- RQ1모델 프리 강화 학습 접근법이 알려지지 않은 비선형 시스템에 대해 피드백 선형화 제어기를 효과적으로 학습할 수 있는가?
- RQ2선형화 제어기 학습 문제의 볼록성 조건은 무엇이며, 이는 최적 해로의 수렴을 보장하는가?
- RQ3함수 근사와 정책 그래디언트 방법을 어떻게 사용하여 연속시간 최적화 문제를 데이터 효율적으로 해결할 수 있는가?
- RQ4시뮬레이션 및 실제 로봇 시스템에서 학습된 제어기와 명목상 모델 기반 제어기 간의 성능 향상은 어떠한가?
- RQ5명목상 모델이 정확하지 않을 경우 학습된 보정항의 포함이 추적 성능을 어떻게 향상시키는가?
주요 결과
- 학습된 구성요소의 기저 함수들이 선형 독립일 경우, 제안된 학습 문제는 강하게 볼록하여 최적 제어기로의 유일한 수렴을 보장한다.
- 기존 적응 제어 방법과 달리 시스템 행렬의 직접 역행렬 계산을 피하기 때문에, 이 프레임워크는 특이성 없는 학습을 보장한다.
- 시뮬레이션 결과, 학습된 제어기는 5초 간격의 사각파 참조 신호 추적에서 명목상 모델 기반 제어기보다 정적 오차를 크게 감소시켰다.
- 실제 로봇 플랫폼에서, 1250개의 1단계 롤아웃(각각 0.05초)을 사용해 100개의 학습 에포크를 수행하는 데 104분이 소요되었으며, 실용적인 데이터로 향상된 추적 성능를 달성했다.
- 학습 후 잔류 추적 오차는 신경망의 표현 능력이 부족함을 시사하며, 더 표현력 있는 함수 근사기의 필요성을 암시한다.
- 이 방법은 기하학적 제어 이론과 모델 프리 강화 학습을 성공적으로 융합하여 불확실한 시스템에 대해 강건하고 효율적인 제어 설계를 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.