Skip to main content
QUICK REVIEW

[논문 리뷰] Making Non-Stochastic Control (Almost) as Easy as Stochastic

Max Simchowitz|arXiv (Cornell University)|2020. 06. 10.
Advanced Bandit Algorithms Research참고 문헌 30인용 수 8
한 줄 요약

이 논문은 비스스로스틱 제어 설정에서 최적의 $\widetilde{\mathcal{O}}(T^{1/2})$ 근거를 달 đạt하기 위해 온라인 뉴턴 스텝을 적응적으로 조정하여 악성 방해 요인에 대응하는 새로운 온라인 제어 알고리즘을 제안한다. 이는 확률적 LQR에서 알려진 최고의 근거율을 따라가며, 임의의 강凸 비용, 부분 관측, 완전히 악성 노이즈를 처리한다. 또한 온라인 LQR에서 확률적 성격이 근거율을 향상시키지 못함을 증명한다.

ABSTRACT

Recent literature has made much progress in understanding \emph{online LQR}: a modern learning-theoretic take on the classical control problem in which a learner attempts to optimally control an unknown linear dynamical system with fully observed state, perturbed by i.i.d. Gaussian noise. It is now understood that the optimal regret on time horizon $T$ against the optimal control law scales as $\widetildeΘ(\sqrt{T})$. In this paper, we show that the same regret rate (against a suitable benchmark) is attainable even in the considerably more general non-stochastic control model, where the system is driven by \emph{arbitrary adversarial} noise (Agarwal et al. 2019). In other words, \emph{stochasticity confers little benefit in online LQR}. We attain the optimal $\widetilde{\mathcal{O}}(\sqrt{T})$ regret when the dynamics are unknown to the learner, and $\mathrm{poly}(\log T)$ regret when known, provided that the cost functions are strongly convex (as in LQR). Our algorithm is based on a novel variant of online Newton step (Hazan et al. 2007), which adapts to the geometry induced by possibly adversarial disturbances, and our analysis hinges on generic "policy regret" bounds for certain structured losses in the OCO-with-memory framework (Anava et al. 2015). Moreover, our results accomodate the full generality of the non-stochastic control setting: adversarially chosen (possibly non-quadratic) costs, partial state observation, and fully adversarial process and observation noise.

연구 동기 및 목표

  • 온라인 LQR 설정에서 스트로스틱 제어와 비스스로스틱 제어의 근거율 간 격차를 해소하기 위해.
  • 스트로스틱 노이즈가 아닌 악성 방해 요인 하에서도 최적의 $\widetilde{\mathcal{O}}(\sqrt{T})$ 근거율이 달성 가능함을 보여주기 위해.
  • 임의의 강凸 비용, 부분 상태 관측, 악성 과정 및 관측 노이즈를 모두 수반하는 효율적인 알고리즘을 개발하기 위해.
  • 온라인 제어의 기본 근거율이 노이즈의 확률적 성격과 독립적이며, 이는 이전에 노이즈 구조가 성능 향상에 기여한다는 가정을 도전하기 위해.
  • 온라인 뉴턴 스텝의 적용 범위를 기억 의존적 손실을 가진 OCO-with-memory 프레임워크로 확장하기 위해.

제안 방법

  • 악성 방해 요인에 의해 유도된 기하학적 특성에 적응하는 새로운 온라인 뉴턴 스텝(Ons)의 변종을 제안한다.
  • 제어 문제를 기억 효과를 가진 구조적 손실 기반 갱신 시퀀스로 모델링하기 위해 OCO-with-memory 프레임워크를 사용한다.
  • 근거와 안정성의 균형을 이루기 위해 정규화 파rameter $\lambda$를 선택한 수정된 Ons 알고리즘을 적용하며, 이로 인해 $\mu$-근거 경계를 확보한다.
  • 제어 목표를 지수-볼록성과 리프시츠 조건을 만족하는 손실로 변환하기 위해 OcoAM(온라인 제어와 적응 메모리)을 통한 손실 변환을 적용한다.
  • 지수-볼록성과 리프시츠 조건 하에서 Ons의 기존 이론적 보장을 활용하여 근거 경계를 유도하고, 이를 제어 설정에 적응시킨다.
  • 문제의 가정 하에 OcoAM 손실이 필요한 정규성 조건(예: $\tau$-지수-볼록성)을 만족함을 입증한다.

실험 결과

연구 질문

  • RQ1비스스로스틱 제어 설정에서 악성 방해 요인 하에 온라인 LQR에서 최적의 $\widetilde{\mathcal{O}}(\sqrt{T})$ 근거율을 달성할 수 있는가?
  • RQ2시스템에 스트로스틱 노이즈가 존재할 경우 악성 노이즈보다 근거율이 본질적으로 향상되는가?
  • RQ3온라인 뉴턴 스텝은 선형 동역학을 가진 비스스로스틱 제어에서 발생하는 기억 의존적, 구조적 손실을 다룰 수 있는가?
  • RQ4시스템 동역학이 알려져 있거나 알려지지 않은 경우 비스스로스틱 제어의 최대한의 근거 경계는 무엇인가?
  • RQ5OCO-with-memory 프레임워크는 일반적인 비스스로스틱 제어 문제에 대해 근거 최소화 알고리즘 설계에 얼마나 효과적으로 활용될 수 있는가?

주요 결과

  • 제안된 알고리즘은 시스템 동역학이 알려지지 않은 비스스로스틱 제어 설정에서 $\widetilde{\mathcal{O}}(\sqrt{T})$ 근거를 달하며, 이는 최적의 확률적 LQR 비율을 따라간다.
  • 시스템 동역학이 알려져 있을 경우, 알고리즘은 $\mathrm{poly}(\log T)$ 근거를 달하며, 이는 여전히 확률적 설정에서 알려진 최고의 경계를 따라간다.
  • 근거 경계는 임의의 강凸 비용, 부분 상태 관측, 완전히 악성 과정 및 관측 노이즈의 전체 일반성 하에서 달성된다.
  • 분석 결과, OcoAM 손실 변환은 $\frac{\alpha}{L_{\mathrm{eff}}^2}$-지수-볼록성과 $R_H L_{\mathrm{eff}}$-리프시츠 조건을 보장하며, 이는 엄밀한 근거 제어를 가능하게 한다.
  • 알고리즘의 성능은 $\lesssim (R_0 D^2 T \mu^2)^{1/3} + R_0$ 형태의 $\mu$-근거 경계에 의해 결정되며, 여기서 $R_0 = \max\{GD, 1/\tau\} \cdot d \log T$ 이다. 최적의 파rameter 조정 하에서 이는 $\sqrt{T}$ 스케일링을 회복한다.
  • 결과들은 온라인 LQR에서 스트로스틱 성격이 근거율을 향상시키지 못함을 보여주며, 동일한 최적의 $\sqrt{T}$ 비율이 악성 방해 요인 하에서도 달성 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.