[논문 리뷰] Policy Search for Model Predictive Control with Application to Agile Drone Flight
이 논문은 확률적 정책 탐색을 통해 모델 예측 제어(MPC)의 고수준 결정보류 변수를 학습하는 방식으로 정책 탐색과 MPC를 통합하는 새로운 프레임워크를 제안한다. MPC를 파arameterized 컨트롤러로 공식화하고, 수동으로 조정하기 어려운 파라미터를 자기지도 정책 학습을 통해 최적화함으로써, 시뮬레이션과 실제 실험 모두에서 빠르게 움직이는 게이트를 통과하는 고성능 드론 비행을 위한 안정적이고 실시간 제어를 가능하게 한다.
Policy Search and Model Predictive Control~(MPC) are two different paradigms for robot control: policy search has the strength of automatically learning complex policies using experienced data, while MPC can offer optimal control performance using models and trajectory optimization. An open research question is how to leverage and combine the advantages of both approaches. In this work, we provide an answer by using policy search for automatically choosing high-level decision variables for MPC, which leads to a novel policy-search-for-model-predictive-control framework. Specifically, we formulate the MPC as a parameterized controller, where the hard-to-optimize decision variables are represented as high-level policies. Such a formulation allows optimizing policies in a self-supervised fashion. We validate this framework by focusing on a challenging problem in agile drone flight: flying a quadrotor through fast-moving gates. Experiments show that our controller achieves robust and real-time control performance in both simulation and the real world. The proposed framework offers a new perspective for merging learning and control.
연구 동기 및 목표
- 고성능 드론 비행에서 MPC 초모수와 결정보류 변수를 수동으로 조정하는 문제를 해결하기 위해.
- 모델 기반 MPC(최적성, 제약 조건 처리)의 강점과 데이터 기반 정책 탐색(자동 적응, 일반화)의 강점을 융합하기 위해.
- 학습된 고수준 정책를 사용하여 빠르게 움직이는 게이트를 통과하는 다우로터의 실시간이고 안정적인 제어를 가능하게 하기 위해.
- 전문가의 예시가 필요로 하지 않으며 효율적인 정책 최적화를 가능하게 하는 자기지도 학습 프레임워크를 개발하기 위해.
- 변동하는 환경 조건을 포함하는 도전적인 실제 제어 과제에서 제안된 프레임워크의 효과성을 입증하기 위해.
제안 방법
- 고수준 결정보류 변수(예: 예측 수평선, 비용 가중치)를 정책 탐색을 통해 학습할 수 있도록 MPC를 파arameterized 컨트롤러로 공식화하기.
- 닫힌 형태의 정책 업데이트를 가능하게 하는 가우시안 정책을 사용하여 상태에 독립적 또는 상태에 의존적인 결정보류 변수를 표현하기.
- MPC 최적화 루프를 활용하여 MPC가 생성한 궤적을 기반으로 정책 학습을 위한 감독 신호를 생성하는 자기지도 학습 기반 학습 전략 제안하기.
- 관측에 따라 결정되는 결정보류 변수를 사용하여 MPC 파라미터를 단계 기반으로 실시간으로 적응시키기 위한 신경망 정책 구현하기.
- 정책 탐색을 통한 MPC 목표의 자동 최적화를 가능하게 하는 민첩한 손실 및 보상 함수 설계하기.
- 이식형 및 단계 기반 정책 탐색 전략을 통합하여 오프라인 및 온라인 정책 학습을 모두 지원하기.
실험 결과
연구 질문
- RQ1정책 탐색을 사용하여 MPC의 고수준 결정보류 변수를 효과적으로 학습시킬 수 있는가? 이는 수동 조정 없이도 제어 성능 향상에 기여하는가?
- RQ2MPC가 생성한 궤적만을 사용하여 자기지도 학습을 활용해 MPC 정책을 훈련시킬 수 있는가?
- RQ3가우시안 정책과 신경망 정책를 사용하여 다양한 비행 환경과 동적 환경에서 MPC 파라미터를 일반화할 수 있는가?
- RQ4제안된 프레임워크는 시뮬레이션과 실제 환경 모두에서 빠르게 움직이는 게이트를 통과하는 고성능 드론 비행에 대해 실시간이고 안정적인 제어를 가능하게 하는가?
- RQ5학습과 모델 기반 제어를 통합함으로써 표준 MPC나 엔드 투 엔드 RL에 비해 성능 향상이 이루어지는가?
주요 결과
- 제안된 프레임워크는 시뮬레이션과 실제 실험 모두에서 고성능 드론 비행을 위한 안정적이고 실시간 제어 성능을 달성하였다.
- 가우시안 정책의 사용을 통해 예측 수평선 및 비용 함수 가중치와 같은 MPC 초모수를 자동으로 조정할 수 있었다.
- 신경망 정책를 통해 실시간 관측에 기반한 MPC 결정보류 변수의 온라인 적응이 가능해져 동적 변화에 대한 반응성이 향상되었다.
- 자기지도 학습 기반 학습 전략은 최소한의 인간 간섭과 전문가의 예시 없이도 복잡한 정책을 성공적으로 학습시켰다.
- 학습된 정책를 통해 MPC 파라미터를 변화하는 조건에 맞게 적응함으로써, 표준 MPC보다 동적 환경에서 성능이 뛰어났다.
- 프레임워크는 일반화 가능하며, 복잡한 궤적 최적화와 제약 조건을 수반하는 다양한 로봇 작업에 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.