Skip to main content
QUICK REVIEW

[논문 리뷰] Game representations for state constrained continuous time linear regulator problems

Peter M. Dower, William M. McEneaney|arXiv (Cornell University)|2019. 04. 11.
Advanced Control Systems Optimization참고 문헌 16인용 수 5
한 줄 요약

이 논문은 볼록 상태 제약 조건이 있는 연속시간 선형 정규화 조절기(LQR) 문제를 게임 이론적 재구성하여, 장벽 함수를 이차 함수들의 상한(superemum)으로 표현함으로써 제안한다. 주요 기여는 제약 조건이 있는 LQR 문제와 제약 조건이 없는 두 명의 플레이어가 참여하는 0-합 게임 간의 등가성을 보여주는 것으로, 리카티 유형의 방정식을 통한 상태 피드백 최적 제어 정책을 가능하게 하고, 계산 가능성을 확보하기 위해 상하 게임 값 간의 등가성을 입증한다.

ABSTRACT

A supremum-of-quadratics representation for convex barrier-type constraints is developed and applied within the context of a class of continuous time state constrained linear regulator problems. Using this representation, it is shown that a linear regulator problem subjected to such a convex barrier-type constraint can be equivalently formulated as an unconstrained two-player linear quadratic game. By demonstrating equivalence of the upper and lower values of this game, state feedback characterizations for the optimal policies of both players are developed. These characterizations are subsequently illustrated by example.

연구 동기 및 목표

  • 표준 이차 구조를 파괴하고 비이차, 해결하기 어려운 해밀토니안-자코비-벨만(HJB) 편미분방정식을 유도하는 볼록 상태 제약 조건이 있는 연속시간 선형 정규화 조절기(LQR) 문제를 해결하는 데 도전하는 것.
  • 장벽 함수의 상-이차 함수 표현을 통한 볼록 완화를 도입하여 제약 조건이 있는 LQR 문제의 차원의 저주와 계산 불가능성 문제를 해결하는 것.
  • 원래의 제약 조건이 있는 LQR 문제와 제약 조건이 없는 두 명의 플레이어가 참여하는 선형-이차 게임 간의 등가성을 확립하여 최적 제어 합성에 게임 이론 도구를 적용할 수 있도록 하는 것.
  • 게임의 양 플레이어에 대한 상태 피드백 최적 정책을 유도함으로써 제약 조건을 만족시키고 원래 문제의 해로 수렴하도록 하는 것.

제안 방법

  • 실수 매개변수로 인덱싱된 이차 페널티 가족의 상한으로 볼록 장벽 함수를 표현하여, 상태에 따라 변하는 이차 페널티를 도입하여 비이차 제약 조건을 근사화하는 것.
  • 상태 제약 조건을 강제하기 위해 페널티 매개변수가 무한대에 갈 수 있도록 하는 정확한 상-이차 함수 표현과, 계산 가능성을 확보하기 위해 매개변수 구간이 유한한 근사 버전을 도입하는 것.
  • 제약 조건이 있는 LQR 문제를 제약 조건이 없는 두 명의 플레이어가 참여하는 0-합 게임으로 재구성하며, 최소화 플레이어는 시스템을 제어하고 최대화 플레이어는 제약 조건을 강제하기 위해 페널티 매개변수를 선택하는 것.
  • 상하 게임 값이 동일함을 입증하여 가치 존재성 보장 및 동적 프rogramming 원리의 적용 가능성을 확보하는 것.
  • 게임의 해밀토니안-자코비-벨만 방정식에서 유도된 미분 리카티 방정식(DRE)을 풀어 두 플레이어의 상태 피드백 최적 정책을 도출하는 것.
  • 가능한 선택과 페널티 이중성(Fenchel duality)을 사용하여 최적 피드백 법칙의 존재성을 확립하고, 가치 함수의 연속성과 볼록성을 증명하는 것.

실험 결과

연구 질문

  • RQ1연속시간 LQR 문제에서 볼록 상태 제약 조건을 등가의 제약 조건이 없는 두 명의 플레이어 게임으로 재구성할 수 있는가?
  • RQ2장벽 함수의 상-이차 함수 표현이 원래 제약 조건이 있는 문제의 최적 값과 궤적 행동을 유지하는가?
  • RQ3상하 게임 값 간의 등가성을 확립하여 가치 존재성 보장 및 계산 가능한 해결 전략 적용 가능성을 확보할 수 있는가?
  • RQ4게임 설정에서 두 플레이어에 대한 상태 피드백 최적 제어 정책을 어떻게 도출할 수 있는가?
  • RQ5페널티 매개변수의 상한이 증가함에 따라 근사 게임 설정이 정확한 제약 조건이 있는 LQR 문제로 수렴하는 수렴 행동은 어떠한가?

주요 결과

  • 볼록 장벽 함수의 정확한 상-이차 함수 표현은 최적 상태 궤적이 닫힌 제약 조건 구역 내에 고정되며, 거의 확실하게 내부에 존재함을 보장한다.
  • 근사 게임 설정은 페널티 매개변수의 상한이 무한대에 갈수록 가치 함수와 최적 궤적 측면에서 정확한 문제로 수렴한다.
  • 두 명의 플레이어 게임의 상하 값이 동일하므로 가치 존재성이 보장되고, 정책 합성에 동적 프로그래밍 원리의 적용이 가능하다.
  • 두 플레이어의 최적 피드백 정책은 미분 리카티 방정식(DRE)의 해를 통해 명시적으로 특성화되며, 효율적인 계산이 가능하다.
  • 게임의 가치 함수는 볼록이고 하부 하우스도르프 연속이며, 그 페널티 이중성(Fenchel 변환)은 명시적으로 계산된다. 이는 장벽 함수와 페널티 매개변수 공간 간의 연결 고리를 제공한다.
  • 제어 플레이어의 최적 정책은 DRE의 해에 의존하며, 적대적 플레이어의 정책은 현재 상태에 따라 페널티 매개변수를 선택함으로써 제약 조건을 강제한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.