Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Optimal Control as Approximate Input Inference

Joe Watson, Hany Abdulsamad|arXiv (Cornell University)|Oct 7, 2019
Gaussian Processes and Bayesian Inference参考文献 22被引用数 5
ひとこと要約

本稿では、制御入力を用いた近似ベイズ推論として定式化される確率的最適制御を扱う、制御の推論(I2C)という新しいフレームワークを紹介する。確率的グラフィカルモデルにおけるメッセージパッシングと期待値最大化(EM)を活用することで、事前分布による原理的な正則化を通じて、明示的なエントロピー項なしに最大エントロピー行動を達成する時変化する線形ガウス制御則を導出する。この手法は、iLQR や GPS よりも優れた収束性と耐障害性を示し、確率的環境下でも優れた性能を発揮する。

ABSTRACT

Optimal control of stochastic nonlinear dynamical systems is a major challenge in the domain of robot learning. Given the intractability of the global control problem, state-of-the-art algorithms focus on approximate sequential optimization techniques, that heavily rely on heuristics for regularization in order to achieve stable convergence. By building upon the duality between inference and control, we develop the view of Optimal Control as Input Estimation, devising a probabilistic stochastic optimal control formulation that iteratively infers the optimal input distributions by minimizing an upper bound of the control cost. Inference is performed through Expectation Maximization and message passing on a probabilistic graphical model of the dynamical system, and time-varying linear Gaussian feedback controllers are extracted from the joint state-action distribution. This perspective incorporates uncertainty quantification, effective initialization through priors, and the principled regularization inherent to the Bayesian treatment. Moreover, it can be shown that for deterministic linearized systems, our framework derives the maximum entropy linear quadratic optimal control law. We provide a complete and detailed derivation of our probabilistic approach and highlight its advantages in comparison to other deterministic and probabilistic solvers.

研究の動機と目的

  • iLQR や GPS といった決定的軌道最適化手法における不安定性とヒューリスティックな正則化を解消すること。
  • 制御を不確実性下での入力推定として再解釈することにより、最適制御とベイズ推論を統合すること。
  • 制御に事前分布を導入することで、原理的な不確実性評価と自然な正則化を可能にすること。
  • 事後状態-行動分布から時変化する線形ガウスフィードバック制御則を導出すること。
  • 明示的なエントロピー正則化なしに、ベイズフレームワークの本質的性質により最大エントロピー制御行動を達成すること。

提案手法

  • 動的システムの確率的グラフィカルモデルを用いて、最適制御を制御入力におけるベイズ推論として再定式化する。
  • Eステップで線形化されたガウスメッセージパッシングを用いた近似的な期待値最大化(EM)を適用し、入力推論を実行する。
  • Mステップで、制御事前分布やノイズ分散といったハイパーパrameterを尤度最大化により最適化する。
  • 事後状態-行動分布から時変化する線形ガウス制御則を導出する。
  • 2次コスト関数とガウスノイズの双対性を用いて、決定的極限におけるLQR解と等価性を確立する。
  • メッセージパッシングを用いて制御則に必要な十分統計量を計算し、離散代数的リカッチ方程式(DARE)と関連付ける。

実験結果

リサーチクエスチョン

  • RQ1最適制御を入力における近似的なベイズ推論として再解釈することで、より安定的かつ原理的な最適化が可能になるか?
  • RQ2iLQR や GPS におけるヒューリスティックな正則化と比較して、制御推論における事前分布の使用はどのように異なるか?
  • RQ3提案フレームワークは、明示的なエントロピー項なしに自然に最大エントロピー制御方策を導出できるか?
  • RQ4局所線形化を用いることで、非線形システムへの一般化はどの程度達成できるか?
  • RQ5確率的環境下におけるコストと耐障害性の観点から、I2C は iLQR や GPS よりも優れた性能を示すか?

主な発見

  • 振り子のスイングアップタスクにおいて、I2C は予測コスト 1.35×10⁴ を達成し、100回の試行における評価コストは 1.37×10⁴ ± 3.82 となり、平均および分散の両面で iLQR や GPS を上回った。
  • CartPole 環境では、I2C は予測コスト 1.73×10⁵、評価コスト 1.74×10⁵ ± 0.14 を達成し、高い一貫性と安定性を示した。
  • ダブルCartPole タスクでは、I2C は予測コスト 3.12×10⁵、評価コスト 3.21×10⁵ ± 1.79 を維持し、コストと分散の両面で iLQR や GPS より顕著に優れた性能を示した。
  • 決定的線形ケースでは標準的な LQR 解が回復され、理論的整合性が確認された。
  • 導出された制御則は、目的関数に明示的なエントロピー正則化がなくても、自然に最大エントロピー特性を示した。
  • I2C は自己正則化的探索を示し、入力の共分散が自信と耐障害性を反映することで、ヒューリスティックなチューニングへの依存を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。