[논문 리뷰] Safe Adaptive Learning-based Control for Constrained Linear Quadratic Regulators with Regret Guarantees
이 논문은 모델 불확실성 하에서 안전 보장을 갖는 제약 조건이 있는 선형 제곱조절기(LQR)를 위한 다항식 시간, 단일 궤적 기반 적응형 학습 기반 제어 알고리즘을 제안한다. 최소 제곱 추정, 확실성 등가와 강건한 제약 조건 만족, 그리고 새로운 안전 이행(SafeTransit) 정책 업데이트 메커니즘을 조합하여, 모델 불확실성 하에서도 실행 가능성과 제약 조건 만족을 보장하며, 알려진 동역학을 갖는 최적의 안전 선형 제어기와 비교해 $ ilde{O}(T^{2/3})$ 이하의 하향적 손실(regret)을 달성한다.
We study the adaptive control of an unknown linear system with a quadratic cost function subject to safety constraints on both the states and actions. The challenges of this problem arise from the tension among safety, exploration, performance, and computation. To address these challenges, we propose a polynomial-time algorithm that guarantees feasibility and constraint satisfaction with high probability under proper conditions. Our algorithm is implemented on a single trajectory and does not require system restarts. Further, we analyze the regret of our learning algorithm compared to the optimal safe linear controller with known model information. The proposed algorithm can achieve a $ ilde O(T^{2/3})$ regret, where $T$ is the number of stages and $ ilde O(\cdot)$ absorbs some logarithmic terms of $T$.
연구 동기 및 목표
- 알 수 없는 선형 시스템에서 상태 및 입력 제약 조건이 존재하는 안전하고 적응형 제어의 과제를 해결하기 위해.
- 시스템 재시작을 피하고 높은 확률로 실행 가능성과 제약 조건 만족을 보장하는 단일 궤적 알고리즘을 개발하기 위해.
- 알려진 모델 기준 최적의 안전 선형 제어기와의 비교에서 손실를 최소화하여 그에 가까운 성능을 달성하기 위해.
- 모델 불확실성과 시간에 따라 변화하는 추정치가 존재하는 경우에도 안전 정책 업데이트를 위한 천천히 변화하는 기법을 확장하기 위해.
- 모델 불확실성 하에서 일반적인(비선형일 수 있는) 정책에 적용 가능한 모델 추정 오차 경계를 제공하기 위해.
제안 방법
- 단일 궤적에서의 관측을 바탕으로 시스템 모델 추정치를 반복적으로 업데이트하기 위해 최소 제곱 추정기(LSE)를 사용한다.
- 모델 불확실성 처리와 제약 조건 이행 보장을 위해 확실성 등가와 강건한 제약 조건 만족 기법을 적용한다.
- 천천히 변화하는 기법을 불확실한 모델로 확장하여 안전한 정책 업데이트를 가능하게 하는 SafeTransit 알고리즘을 도입한다.
- 추정 오차와 손실 오차를 제한하기 위해 시간 평균화와 마팅게일 기반 분석을 활용한다.
- 시간 평균화와 농도 불확실성 불등식을 활용하여 손실를 추정 오차와 정책 오차 성분으로 분해하는 재귀적 분해 기법을 사용한다.
- 기존 선형 정책에 국한된 결과를 일반화하여 비선형 정책에 대해 유효한 일반적인 모델 추정 오차 경계를 유도한다.
실험 결과
연구 질문
- RQ1모델 불확실성 하에서도 안전성과 제약 조건 만족을 보장하는 단일 궤적 기반 적응형 제어 알고리즘을 제약 조건이 있는 LQR에 대해 설계할 수 있는가?
- RQ2제약 조건이 있는 LQR의 적응형 제어에서 탐색, 안전성, 성능 간의 근본적 상충 관계는 무엇인가?
- RQ3알려진 모델 정보를 갖는 최적의 안전 선형 제어기와 비교해 $ ilde{O}(T^{2/3})$ 수준의 손실 경계를 달성할 수 있는가?
- RQ4모델 추정치가 시간에 따라 변화하고 불확실할 경우 안전한 정책 업데이트를 어떻게 확보할 수 있는가?
- RQ5모델 불확실성 하에서 비선형 정책에 대해 일반적인 모델 추정 오차 경계는 무엇인가?
주요 결과
- 적절한 조건 하에서, 이 알고리즘은 시스템 재시작 없이도 높은 확률로 실행 가능성과 제약 조건 만족을 보장한다.
- 알려진 모델 정보를 갖는 최적의 안전 선형 제어기와 비교해 $ ilde{O}(T^{2/3})$ 이하의 손실 경계를 달성한다.
- Mayne 등(2005)의 RMPC 정책과 비교했을 때도 이 손실 경계가 유지되며, 강건 제어 기준과 비교해 뛰어난 성능을 보임을 시사한다.
- 유도된 모델 추정 오차 경계는 일반적이고 비선형 정책에 대해 유효하며, 이전에 선형 정책에 국한된 결과를 확장한다.
- SafeTransit 알고리즘은 천천히 변화하는 기법을 불확실한 모델로 성공적으로 확장하여 단일 궤적에서 안전하고 적응형 정책 업데이트를 가능하게 한다.
- 분석은 마팅게일 농도 불확실성 불등식과 시간 평균화 기법을 활용하여 누적 손실과 추정 오차를 제한한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.