Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Regret for Control of Time-Varying Dynamics

Paula Gradu, Elad Hazan|arXiv (Cornell University)|2020. 07. 08.
Advanced Bandit Algorithms Research참고 문헌 31인용 수 14
한 줄 요약

이 논문은 시간에 따라 변화하는 선형 동적 시스템에서 하위선형 재해로를 가진 어떤 컨트롤러라도 하위선형 적응 재해로를 갖는 것으로 변환하는 새로운 메타알고리즘을 소개한다. 메모리가 있는 온라인 볼록 최적화와 새로운 적응 재해로 경계를 활용함으로써, 이 방법은 변화하는 시스템 동역학에 동적으로 적응할 수 있도록 컨트롤러를 가능하게 하며, 비확률적 환경에서 거의 날카로운 재해로 경계를 달성한다.

ABSTRACT

We consider the problem of online control of systems with time-varying linear dynamics. This is a general formulation that is motivated by the use of local linearization in control of nonlinear dynamical systems. To state meaningful guarantees over changing environments, we introduce the metric of {\it adaptive regret} to the field of control. This metric, originally studied in online learning, measures performance in terms of regret against the best policy in hindsight on {\it any interval in time}, and thus captures the adaptation of the controller to changing dynamics. Our main contribution is a novel efficient meta-algorithm: it converts a controller with sublinear regret bounds into one with sublinear {\it adaptive regret} bounds in the setting of time-varying linear dynamical systems. The main technical innovation is the first adaptive regret bound for the more general framework of online convex optimization with memory. Furthermore, we give a lower bound showing that our attained adaptive regret bound is nearly tight for this general framework.

연구 동기 및 목표

  • 비선형 동적 시스템을 시간에 따라 변화하는 동역학으로 제어하는 데 도전하는 데 목적이 있다. 이는 局부 선형화를 사용한다.
  • 표준 재해로 측정법이 실패하는 비정상적인 환경에서 온라인 제어의 성능 보장을 개발하는 데 목적이 있다.
  • 제어 이론에서 변화하는 동역학에 적응할 수 있는 능력을 반영하는 의미 있는 성능 지표로 적응 재해로를 도입하는 데 목적이 있다.
  • 표준 재해로 최소화 컨트롤러를 적응 재해로 최소화 컨트롤러로 변환하는 효율적인 메타알고리즘을 설계하는 데 목적이 있다.
  • 메모리가 있는 온라인 볼록 최적화에 대한 적응 재해로의 거의 날카로운 하한을 설정하는 데 목적이 있다.

제안 방법

  • 프록시 손실 함수에 대해 온라인 경사 하강법을 사용하여 업데이트되는 여러 전문가 컨트롤러를 유지하는 메타알고리즘을 제안한다.
  • 시간에 따라 변화하는 집합 시스템 $S_t$를 사용하여 컨트롤러에 대한 가중치를 유지하고 업데이트함으로써 시간 복잡도를 로그 수준으로 유지한다.
  • 미래 성능를 추정하고 각 타임스텝에서 컨트롤러 선택을 안내하기 위해 대체 프록시 비용 함수를 사용한다.
  • 프레임워크를 메모리가 있는 온라인 볼록 최적화에 적용하여 이 일반적 설정에서 처음으로 적응 재해로 경계를 유도한다.
  • 특정 시간 간격에서 가장 잘 성과를 내는 전문가로 제어를 동적으로 이관하는 새로운 가중치 업데이트 규칙을 도입한다.
  • 각 단계에서 시간에 따라 변화하는 선형화된 시스템 동역학 $(A_t, B_t)$를 계산하기 위해 자동 미분을 사용한다.

실험 결과

연구 질문

  • RQ1비확률적 환경에서 시간에 따라 변화하는 선형 동역학에 효과적으로 적응할 수 있는 컨트롤러를 설계할 수 있는가?
  • RQ2온라인 제어에서 재해로 최소화를 어떻게 확장하여 변화하는 시스템 행동에 대한 적응을 포착할 수 있는가?
  • RQ3시간에 따라 변화하는 시스템에서 메모리가 있는 온라인 볼록 최적화에 대해 최적의 달성 가능한 적응 재해로 경계는 무엇인가?
  • RQ4메타알고리즘이 효율적으로 표준 재해로 최소화 컨트롤러를 하위선형 적응 재해로 최소화 컨트롤러로 변환할 수 있는가?
  • RQ5유도된 적응 재해로 경계가 로그 인자 수준까지 날카로운가?

주요 결과

  • 제안된 메타알고리즘은 시간에 따라 변화하는 선형 동적 시스템에서 하위선형 적응 재해로를 달성하여 변화하는 동역학에 효과적으로 적응할 수 있다.
  • 이 방법은 메모리가 있는 온라인 볼록 최적화에 대해 처음으로 적응 재해로 경계를 확립하였으며, 광범위한 의미를 지닌 일반적 프레임워크이다.
  • 거의 날카로운 하한이 증명되었으며, 달성된 적응 재해로 경계가 로그 인자 수준까지 최적이라는 것을 보여준다.
  • 실험 결과, MARC 메타알고리즘이 GPC 및 iLQR와 같은 기준 컨트롤러보다 비정상적인 환경에서 시간에 따라 변화하는 동역학을 가진 시스템에서 더 뛰어난 성능을 보였다.
  • 알고리즘은 타임스텝당 $O(\log T)$개의 워킹 세트를 유지하여, 동적인 컨트롤러 선택에도 불구하고 계산 효율성을 확보한다.
  • 하이퍼파rameter 튜닝 결과, 실험에서 최적 성능가 $\eta = 0.05$ 및 $\sigma = 10^{-2}$에서 달성되었으며, 이는 메서드의 강건성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.