Skip to main content
QUICK REVIEW

[논문 리뷰] Online Optimal Control with Affine Constraints

Yingying Li, Subhro Das|arXiv (Cornell University)|2020. 10. 10.
Advanced Bandit Algorithms Research참고 문헌 47인용 수 4
한 줄 요약

이 논문은 유한한 외란에 의해 영향을 받는 선형 시스템에 대해 약한 상태 및 행동 제약 조건을 갖는 온라인 최적 제어 알고리즘인 버퍼 영역을 갖는 온라인 경사 하강법(OGD-BZ)을 제안한다. OGD-BZ는 모든 시간 단계에서 강력한 제약 조건 만족을 보장하며, 정책 회귀 상한을 $\tilde{O}(\sqrt{T})$로 갖는다. 이는 비정상적인 비용 변화 상황에서 비선형적 회귀와 경직된 제약 조건 만족을 동시에 보장하는 이론적 보장을 갖는 최초의 알고리즘이다.

ABSTRACT

This paper considers online optimal control with affine constraints on the states and actions under linear dynamics with bounded random disturbances. The system dynamics and constraints are assumed to be known and time-invariant but the convex stage cost functions change adversarially. To solve this problem, we propose Online Gradient Descent with Buffer Zones (OGD-BZ). Theoretically, we show that OGD-BZ with proper parameters can guarantee the system to satisfy all the constraints despite any admissible disturbances. Further, we investigate the policy regret of OGD-BZ, which compares OGD-BZ's performance with the performance of the optimal linear policy in hindsight. We show that OGD-BZ can achieve a policy regret upper bound that is the square root of the horizon length multiplied by some logarithmic terms of the horizon length under proper algorithm parameters.

연구 동기 및 목표

  • 비정상적인 변화를 겪는 볼록 비용을 동시에 최소화하고, 유한한 랜덤 외란이 존재하더라도 경직된 제약 조건 만족을 보장하는 온라인 제어 알고리즘을 설계하는 것.
  • 기존 문헌에서의 격차를 보완하기 위해, 시간에 따라 변하는 제약 조건이 있는 제어 환경에서 비선형 정책 회귀와 강력한 제약 조건 만족에 대한 이론적 보장을 제공하는 것.
  • 최적화 프레임워크 내 버퍼 영역 설계를 통해 제약 조건의 강성과 회귀 성능 간의 상호 작용을 명시적으로 특성화하는 것.

제안 방법

  • 강력한 최적화 및 비제약 온라인 제어 기법을 활용하여, 시간에 따라 연결된 비용과 제약 조건을 갖는 등가의 온라인 볼록 최적화(OCO) 문제로 제약 조건이 있는 온라인 최적 제어 문제를 변환한다.
  • 문제 변환 과정에서 발생하는 근사 오차를 고려하기 위해 제약 집합을 강화하고, 외란 하에서도 강력한 타당성을 확보하기 위해 버퍼 영역을 도입한다.
  • 변환된 OCO 문제에 대해 온라인 경사 하강법(OGD)을 적용하여 OGD-BZ 알고리즘을 도출한다.
  • 상태 및 행동 변수에 대한 약선형 제약 조건을 처리하기 위해 절댓값을 포함하는 부등식 제약 조건의 재구성 기법을 사용한다.
  • 보수성(버퍼 영역 크기로 조절)과 회귀 성능 간의 균형을 이루는 매개변수화된 탐색 공간을 활용한다.
  • 정규화된 행렬의 프로베니우스 노름과 기울기 노름에 대한 이론적 상한을 유도하여, 회귀 및 타당성 보장을 확립한다.

실험 결과

연구 질문

  • RQ1유한하고 비정상적인 외란이 존재하는 상황에서, 온라인 제어 알고리즘이 비선형 정책 회귀를 달성하면서도 경직된 제약 조건 만족을 보장할 수 있는가?
  • RQ2약선형 제약 조건이 있는 온라인 제어에서 제약 조건의 강성과 회귀 성능 간의 상호 작용을 어떻게 공식적으로 특성화하고 제어할 수 있는가?
  • RQ3행동 가능 영역을 과도하게 제한하지 않으면서도 제약 조건 만족을 보장할 수 있는 최적의 버퍼 영역 설계는 무엇인가?

주요 결과

  • 적절한 버퍼 영역 매개변수 설정 하에, OGD-BZ는 $\bar{w}$로 제한된 외란이 존재하더라도 모든 시간 단계에서 상태 및 행동 제약 조건을 만족한다.
  • 적절한 알고리즘 매개변수와 가정 하에, OGD-BZ의 정책 회귀는 $\tilde{O}(\sqrt{T})$로 상한이 설정되며, 이는 시간 길이 $T$에 대해 비선형적이다.
  • 이 회귀 상한은 시스템 차원과 외란 범위에 따라 달라지며, $\delta_1$이 $\bar{w}$에 대해 역수로 의존함에도 불구하고 $L\delta_1$은 $\bar{w}$에 대해 선형적으로 유지된다. 이는 기울기 상한 $G_f$의 제곱 스케일링 때문이며, 이는 $\delta_1 = \Theta(\sqrt{mn} + \sqrt{k_c})$로 유도된다.
  • 알고리즘은 제약 조건의 강성과 회귀 성능 간의 명시적 트레이드오프를 제공한다: 더 큰 버퍼 영역은 제약 조건 만족도를 높이지만 회귀는 증가하고, 반대로 더 작은 버퍼 영역은 반대의 영향을 미친다.
  • 이론적 분석 결과, OGD-BZ의 타당 집합은 완화된 제약 집합 $\Gamma_\epsilon$ 내에 포함되며, 최소 제약 위반 마진은 $\epsilon_*$ 이하로 하한이 설정된다.
  • 헤시안 유사 행렬 $\bm{M}$ 및 이중 변수 $\bm{Y}^x, \bm{Y}^u, \bm{Z}$의 프로베니우스 노름은 $\delta_1 = \Theta(\sqrt{mn} + \sqrt{k_c})$로 유계이며, 이는 회귀 상한에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.