Skip to main content
QUICK REVIEW

[논문 리뷰] Risk Sensitive, Nonlinear Optimal Control: Iterative Linear Exponential-Quadratic Optimal Control with Gaussian Noise

Farbod Farshidian, Jonas Buchli|arXiv (Cornell University)|2015. 12. 22.
Motor Control and Adaptation참고 문헌 3인용 수 16
한 줄 요약

이 논문은 비선형 확률적 최적 제어를 위한 반복적 알고리즘인 ILEG를 제안한다. 이는 성능의 고차 통계량을 포착하기 위해 지수-이차 비용 함수를 통합함으로써 순차적 선형-이차(SLQ) 방법을 확장한다. 위험 민감도 파라미터 σ를 조정함으로써 ILEG는 양의 σ일 경우 고이득 피드백 제어기(고성능), 음의 σ일 경우 강건한 피드포워드 계획(고안정성)을 생성하여 확률적 불확실성 하에서 성능과 강건성 간의 트레이드오프를 가능하게 한다.

ABSTRACT

In this contribution, we derive ILEG, an iterative algorithm to find risk sensitive solutions to nonlinear, stochastic optimal control problems. The algorithm is based on a linear quadratic approximation of an exponential risk sensitive nonlinear control problem. ILEG allows to find risk sensitive policies and thus generalizes previous algorithms to solve nonlinear optimal control based on iterative linear-quadratic methods. Depending on the setting of the parameter controlling the risk sensitivity, two different strategies on how to cope with the risk emerge. For positive-value parameters, the control policy uses high feedback gains whereas for negative-value parameters, it uses a robust feedforward control strategy (a robust plan) with low gains. These results are illustrated with a simple example. This note should be considered as a preliminary report.

연구 동기 및 목표

  • 기본적인 SLQ 방법이 확실성 원칙에 따라 과정 노이즈 통계량을 忽시하는 한계를 해결하기 위해.
  • 위험 민감 제어를 통해 성능 지표의 고차 모멘트(특히 분산과 왜도)를 포함하는 반복적 알고리즘을 개발하기 위해.
  • 비선형 확률적 최적 제어 문제에 대해 명시적 위험 민감도를 처리할 수 있도록 반복적 LQ 방법을 일반화하기 위해.
  • 위험 민감도 파라미터 σ가 제어 정책 설계에서 피드백 이득과 강건성 간의 기본적인 트레이드오프를 어떻게 조절하는지 보여주기 위해.

제안 방법

  • 알고리즘은 원래의 비선형 확률적 최적 제어 문제에 대해 순차적 선형-이차 근사를 사용한다.
  • 각 반복 단계에서 비용이 이차 함수의 지수인 局소 선형-지수-이차(LEG) 문제를 설정한다.
  • 위험 민감도 파라미터 σ는 지수 변환을 통해 비용 함수 내 고차 모멘트(분산, 왜도)의 영향을 조절한다.
  • 각 LEG 하위 문제의 해는 동적 프rogramming을 사용하여 계산되며, 선형 시스템에 대한 지수-이차 비용에 대해 가용한 해석적 해를 활용한다.
  • 알고리즘은 이러한 LEG 하위 문제를 반복적으로 풀면서 제어 정책과 상태 궤적을 갱신하여 수렴할 때까지 반복한다.
  • 기존의 SLQ 방법을 일반화하기 위해 σ ≠ 0을 允許하며, σ = 0일 경우 기존의 SLQ 해를 회복한다.

실험 결과

연구 질문

  • RQ1반복적 LQ 방법은 비선형 확률적 시스템에서 위험 민감 제어를 어떻게 확장할 수 있는가?
  • RQ2위험 민감도 파라미터 σ는 불확실성 하에서 제어 정책 행동에 어떤 역할을 하는가?
  • RQ3제안된 ILEG 알고리즘은 표준 SLQ와 피드백 이득과 강건성 측면에서 어떻게 다를까?
  • RQ4다양한 σ 값에서 ILEG의 안정성 및 수렴 성질은 어떠한가?
  • RQ5σ의 부호와 크기에 따라 ILEG는 강성 있는 피드백 또는 강건한 피드포워드와 같은 본질적으로 다른 제어 전략을 생성할 수 있는가?

주요 결과

  • 양의 σ 값에서는 분산을 줄이기 위해 고이득 피드백 제어를 사용하여 빠르고 민감한 제어 정책을 생성한다.
  • 음의 σ 값에서는 낮은 이득을 사용하고 강건한 피드포워드 계획을 강조하여 더 안전하고 보수적인 궤적을 이끈다.
  • 연속적인 절벽 세계 예제에서 알고리즘이 몇 번의 반복 내에 수렴하여 계산 효율성을 입증한다.
  • 시험 예제에서 σ의 상한은 50이다; 이를 초과하면 제어기가 불안정해지므로 위험 민감도 조정에 대한 근본적인 제약 조건이 있음을 시사한다.
  • 음의 σ일 경우 경로의 변동 범위(오차 밴드)가 넓어지며, 이는 더 높은 시스템 불확실성을 반영한다. 반면 양의 σ는 더 좁고 정밀한 경로를 제공한다.
  • σ = 0일 경우 ILEG 알고리즘이 표준 SLQ로 감소함으로써 기존 방법과의 일관성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.