[논문 리뷰] Learning convex bounds for linear quadratic control policy synthesis
이 논문은 알려지지 않은 시스템 파라미터의 사후 분포에 대한 기대 LQR 비용을 최소화함으로써 제한된 데이터에서 강건한 선형 제곱제어 정책을 학습하기 위한 베이지안 최적화 방법을 제안한다. 순차적 볼록 프로그래밍과 주요화-최소화 원리를 사용하여 국소 수렴성과 강건 안정성을 보장하며, 시뮬레이션과 실제 인verted 펜듈럼 실험에서 최악의 경우 및 명목상 방법보다 뛰어난 성능을 보이며 높은 데이터 효율성과 시스템 차원에 관계없이 일관된 안정화를 달성한다.
Learning to make decisions from observed data in dynamic environments remains a problem of fundamental importance in a number of fields, from artificial intelligence and robotics, to medicine and finance. This paper concerns the problem of learning control policies for unknown linear dynamical systems so as to maximize a quadratic reward function. We present a method to optimize the expected value of the reward over the posterior distribution of the unknown system parameters, given data. The algorithm involves sequential convex programing, and enjoys reliable local convergence and robust stability guarantees. Numerical simulations and stabilization of a real-world inverted pendulum are used to demonstrate the approach, with strong performance and robustness properties observed in both.
연구 동기 및 목표
- 모델 불확실성 하에서 강건 안정성이 보장되는 데이터 효율적인 제어 정책 학습 방법을 개발하기 위해.
- 시스템 파라미터의 사후 분포에 대한 기대 LQR 비용을 최적화하여 성능와 강건성의 균형을 이루기 위해.
- 확률적 불확실성 정량화를 활용하여 최악의 경우 강건 제어의 과도한 보수성 문제를 해결하기 위해.
- 볼록 근사화를 통해 국소 수렴성과 학습된 정책의 안정성을 보장하기 위해.
- 모의 실험과 실제 하드웨어 제어 작업 모두에서 뛰어난 성능과 강건성을 입증하기 위해.
제안 방법
- 관측된 데이터로부터 시스템 파라미터의 불확실성을 모델링하기 위해 베이지안 프레임워크를 사용하여 사후 분포를 형성한다.
- 기대 LQR 비용에 대한 볼록 상한을 구성하기 위해 주요화-최소화(MM) 원리를 적용하여 순차적 볼록 최적화를 가능하게 한다.
- 이 볼록 근사화는 준선형계획법을 통해 해결되어 계산 가능성을 보장하고 국소 수렴성을 확보한다.
- 사후 불확실성 집합에서 유도된 볼록 제약 조건을 통합하여 강건 안정성을 보장한다.
- 기대 비용을 근사하고 타당한 시스템 모델에 대한 안정성 검증을 위해 사후 분포에서 몬테카를로 샘플링을 수행한다.
- 모의 실험과 실제 하드웨어 실험 모두에서 최악의 경우, 명목상, 및 $H_2/H_\infty$ 기반 방법과의 비교를 수행한다.
실험 결과
연구 질문
- RQ1모델 불확실성 하에서 기대 LQR 성능를 최적화하면서도 강건 안정성을 보장하는 제어 정책을 학습할 수 있는가?
- RQ2고차원 시스템에서 기대 비용 최적화 성능와 최악의 경우 또는 명목상 정책 합성 방식과의 비교에서 성능와 안정성은 어떻게 다를까?
- RQ3베이지안 불확실성 정량화는 제어 정책 학습에서 데이터 효율성을 얼마나 향상시키는가?
- RQ4데이터가 부족하거나 시스템 차원이 증가할 경우 제안된 방법은 타당성과 안정성을 유지하는가?
- RQ5실제 하드웨어에서 제안된 방법의 제어 신호와 시스템 반응은 기준 방법과 어떻게 비교되는가?
주요 결과
- 테스트된 모든 시스템 차원에서 95% 사후 신뢰 영역에서 샘플링된 모델의 100%를 안정화했으며, $n_x = 12$일 경우 최악의 경우 방법이 46%의 경우에서 실패한 것을 고려할 때 뛰어난 성능을 보였다.
- $n_x = 3$일 경우, $M \geq 800$ 몬테카를로 샘플을 사용하여 중앙값 불안정률이 0.10%에 도달했으며, 이는 유한한 샘플링 조건에서도 강건함을 시사한다.
- 회전형 인버티드 펜듈럼에서의 실제 실험에서, 제안된 방법은 기준 방법보다 더 낮은 LQR 비용과 더 작은 제어 신호 크기를 달성했으며, 특히 데이터가 적은 환경에서 두드러진 성능을 보였다.
- 최악의 경우 및 $H_2/H_\infty$ 방법이 높은 불확실성으로 인해 타당하지 않아지는 상황에서도 제안된 방법은 타당하고 안정적인 상태를 유지했다.
- 성능 수렴이 매우 빠르게 이루어져 실제 하드웨어에서 단 10회의 롤아웃 이후 안정화가 달성되었으며, 이는 매우 높은 데이터 효율성을 보여준다.
- $n_x = 12$에서 최적 정책에 비해 0.27% 이내의 부적합도를 달성하면서도 강건성과 타당성을 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.