[논문 리뷰] Online Learning for Receding Horizon Control with Provable Regret Guarantees.
이 논문은 시간에 따라 변화하는 비용 함수를 가진 알려지지 않은 선형 동적 시스템을 제어하기 위해 두 가지 온라인 후퇴 예측 제어(RHC) 알고리즘—확실성 등가 RHC(CE-RHC)와 낙관적 RHC(O-RHC)—를 제안한다. 표준 안정성 가정 하에서, CE-RHC는 $\mathcal{O}(T^{2/3})$의 동적 회귀를 달성한다. O-RHC는 진정한 시스템에 대해서만 안정성이 확보되는 경우에도 이 보장을 연장하지만, 추가적인 계산 비용을 지불한다.
We address the problem of learning to control an unknown linear dynamical system with time varying cost functions through the framework of online Receding Horizon Control (RHC). We consider the setting where the control algorithm does not know the true system model and has only access to a fixed-length (that does not grow with the control horizon) preview of the future cost functions. We characterize the performance of an algorithm using the metric of dynamic regret, which is defined as the difference between the cumulative cost incurred by the algorithm and that of the best sequence of actions in hindsight. We propose two different online RHC algorithms to address this problem, namely Certainty Equivalence RHC (CE-RHC) algorithm and Optimistic RHC (O-RHC) algorithm. We show that under the standard stability assumption for the model estimate, the CE-RHC algorithm achieves $\mathcal{O}(T^{2/3})$ dynamic regret. We then extend this result to the setting where the stability assumption hold only for the true system model by proposing the O-RHC algorithm. We show that O-RHC algorithm achieves $\mathcal{O}(T^{2/3})$ dynamic regret but with some additional computation.
연구 동기 및 목표
- 알려지지 않은 선형 동적 시스템과 시간에 따라 변화하는 비용 함수를 가진 온라인 제어 문제를 다루기 위해.
- 완전한 시스템 모델 지식이 없을 경우에도 증명 가능한 동적 회귀 보장을 달성하는 알고리즘을 개발하기 위해.
- 한정된 미래 비용 미리보기(고정 길이, 제어 수명 주기와 함께 증가하지 않음) 조건 하에서 운영하기 위해.
- 안정성 가정이 진정한 시스템 모델에 대해서만 적용되는 경우에도 회귀 보장을 연장하기 위해.
- 온라인 제어에서 회귀 성능와 계산 오버헤드 사이의 균형을 맞추기 위해.
제안 방법
- 고정 길이의 미래 비용 사전 보기 조건 하에서 온라인 후퇴 예측 제어(RHC) 프레임워크 내에서 제어 문제를 수립한다.
- 추정된 시스템 모델과 표준 RHC 최적화를 사용하여 확실성 등가 RHC(CE-RHC) 알고리즘을 설계한다.
- 모델 추정치가 불안정한 경우를 다루기 위해 낙관적 업데이트 전략을 사용하는 낙관적 RHC(O-RHC) 알고리즘을 도입한다.
- 동적 회귀를 성능 지표로 사용하여 누적 비용을 후행적으로 최적의 행동 시퀀스와 비교한다.
- 추정 모델에 대한 안정성 가정 하에서의 회귀 한계를 도출한다(CE-RHC), 그리고 진정한 모델에 대한 안정성 가정 하에서의 회귀 한계를 도출한다(O-RHC).
- 표준 선형 시스템 이론과 온라인 학습 기법을 사용하여 모델 불확실성 존재 하에서도 수렴성과 안정성을 보장한다.
실험 결과
연구 질문
- RQ1시스템 모델이 알려지지 않았고, 미래 비용의 고정 길이 사전 보기만 제공되는 조건 하에서 온라인 RHC가 증명 가능한 동적 회귀 보장을 달성할 수 있는가?
- RQ2모델 추정치에 대한 표준 안정성 가정 하에서 온라인 RHC가 달성할 수 있는 최선의 동적 회귀는 무엇인가?
- RQ3모델 추정치가 불안정하지만 진정한 시스템은 안정적인 경우에도 회귀 보장을 연장할 수 있는가?
- RQ4O-RHC에서 낙관적 업데이트로 인한 추가 계산 비용은 회귀 성능에 어떤 영향을 미치는가?
- RQ5시간에 따라 변화하는 시스템에 대한 온라인 RHC에서 회귀 성능와 계산 복잡도 사이의 상충 관계는 무엇인가?
주요 결과
- 표준 안정성 가정 하에서 추정 모델에 대해 CE-RHC 알고리즘이 $\mathcal{O}(T^{2/3})$의 동적 회귀를 달성한다.
- O-RHC 알고리즘은 동일한 $\mathcal{O}(T^{2/3})$의 동적 회귀 한계를 달성하지만, 진정한 시스템 모델에 대해서만 적용 가능한 더 약한 안정성 가정 하에서이다.
- O-RHC 알고리즘은 더 약한 가정 조건 하에서도 회귀 보장을 유지하기 위해 CE-RHC보다 추가적인 계산을 필요로 한다.
- 사전 보기 길이가 제어 수명 주기와 함께 증가하지 않는 제한된 미래 비용 사전 보기 조건에서도 제안된 알고리즘이 효과적으로 작동한다.
- 결과적으로, 모델 불확실성이 존재하는 시간에 따라 변화하는 선형 시스템에 대한 온라인 RHC에서 증명 가능한 회귀 한계를 달성할 수 있음을 보여준다.
- 이 프레임워크는 전체 시스템 모델 지식이 없거나 사전 보기 길이가 증가하지 않는 조건에서도 강력한 온라인 제어 접근법을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.