Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Optimal Control as Approximate Input Inference

Joe Watson, Hany Abdulsamad|arXiv (Cornell University)|2019. 10. 07.
Gaussian Processes and Bayesian Inference참고 문헌 22인용 수 5
한 줄 요약

이 논문은 제어 입력에 대한 근사 베이지안 추론으로서의 입력 추론 제어(I2C)를 소개한다. I2C는 확률적 그래픽 모델과 기대값 최대화(EM)를 활용하여, 제어 입력에 대한 근사 베이지안 추론으로서의 확률적 최적 제어를 공식화한다. 이는 선형 가우시안 제어기를 원칙적인 사전 분포를 통한 정규화를 통해 시간에 따라 변화하는 방식으로 유도하며, 명시적인 엔트로피 항 없이 최대 엔트로피 행동을 달성하고, iLQR와 GPS보다도 더 높은 수렴성과 강건성을 확보하여 확률적 환경에서 뛰어난 성능을 발휘한다.

ABSTRACT

Optimal control of stochastic nonlinear dynamical systems is a major challenge in the domain of robot learning. Given the intractability of the global control problem, state-of-the-art algorithms focus on approximate sequential optimization techniques, that heavily rely on heuristics for regularization in order to achieve stable convergence. By building upon the duality between inference and control, we develop the view of Optimal Control as Input Estimation, devising a probabilistic stochastic optimal control formulation that iteratively infers the optimal input distributions by minimizing an upper bound of the control cost. Inference is performed through Expectation Maximization and message passing on a probabilistic graphical model of the dynamical system, and time-varying linear Gaussian feedback controllers are extracted from the joint state-action distribution. This perspective incorporates uncertainty quantification, effective initialization through priors, and the principled regularization inherent to the Bayesian treatment. Moreover, it can be shown that for deterministic linearized systems, our framework derives the maximum entropy linear quadratic optimal control law. We provide a complete and detailed derivation of our probabilistic approach and highlight its advantages in comparison to other deterministic and probabilistic solvers.

연구 동기 및 목표

  • iLQR와 GPS와 같은 결정론적 궤적 최적화 방법에서의 불안정성과 히وري스틱 정규화 문제를 해결하기 위해.
  • 제어를 불확실성 하에서의 입력 추정으로 재해석함으로써 최적 제어와 베이지안 추론을 통합하기 위해.
  • 제어에 대한 사전 분포를 통해 원칙적인 불확실성 측정과 자연스러운 정규화를 가능하게 하기 위해.
  • 사후 상태-행동 분포에서 시간에 따라 변화하는 선형 가우시안 피드백 제어기를 도출하기 위해.
  • 명시적인 엔트로피 정규화 없이도 베이지안 프레임워크 내재적으로 최대 엔트로피 제어 행동을 달성하기 위해.

제안 방법

  • 역동 시스템의 확률적 그래픽 모델을 사용하여 최적 제어를 제어 입력에 대한 베이지안 추론으로 재구성한다.
  • E단계에서 선형화된 가우시안 메시지 전파를 사용한 근사 기대값 최대화(EM)를 적용하여 입력 추론을 수행한다.
  • M단계에서 제어 사전분포와 노이즈 분산과 같은 초모수를 가능도 최대화를 통해 최적화한다.
  • 사후 공동 상태-행동 분포에서 시간에 따라 변화하는 선형 가우시안 제어기를 유도한다.
  • 이차 비용 함수와 가우시안 노이즈 사이의 이중성(duality)을 활용하여 결정론적 극한에서 LQR와의 등가성을 확립한다.
  • 메시지 전파를 통해 제어 법칙에 필요한 충분통계량을 계산하며, 이는 이산 대수적 리카티 방정식(DARE)과 연결된다.

실험 결과

연구 질문

  • RQ1최적 제어를 입력에 대한 근사 베이지안 추론으로 재해석할 수 있는가? 이는 더 안정적이고 원칙적인 최적화를 이끌 수 있는가?
  • RQ2iLQR와 GPS와 같은 방법에서의 히وري스틱 정규화와 비교해, 제어 추론에서 사전분포를 사용할 경우의 성능은 어떠한가?
  • RQ3제안된 프레임워크는 명시적인 엔트로피 항 없이도 자연스럽게 최대 엔트로피 제어 정책을 도출할 수 있는가?
  • RQ4국소 선형화를 통해 비선형 시스템으로의 일반화 정도는 어느 정도인가?
  • RQ5비용과 강건성 측면에서, I2C는 iLQR와 GPS보다 확률적 환경에서 어떻게 성능을 발휘하는가?

주요 결과

  • 펜듈럼 스윙업 작업에서 I2C는 예측 비용 1.35×10⁴를 기록하였으며, 100회의 시험에서 평가 비용은 1.37×10⁴ ± 3.82로 평균과 분산 모두에서 iLQR와 GPS를 뛰어넘었다.
  • 카트폴 환경에서는 I2C가 예측 비용 1.73×10⁵와 평가 비용 1.74×10⁵ ± 0.14를 기록하여 높은 일관성과 안정성을 보였다.
  • 더블 카트폴 작업에서는 I2C가 예측 비용 3.12×10⁵와 평가 비용 3.21×10⁵ ± 1.79를 유지하며, 비용과 분산 측면에서 iLQR와 GPS를 크게 앞서는 성능을 보였다.
  • 결정론적 선형 케이스에서 표준 LQR 해를 회복하여 이론적 일관성을 확인하였다.
  • 유도된 제어기는 명시적인 엔트로피 정규화 없이도 자연스럽게 최대 엔트로피 특성을 보였다.
  • I2C는 자기 정규화 탐색을 보이며, 입력 공분산이 신뢰도와 강건성을 반영하여 히وري스틱 튜닝에 대한 의존도를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.