Skip to main content
QUICK REVIEW

[論文レビュー] Fitting a Linear Control Policy to Demonstrations with a Kalman Constraint

Malayandi Palan, Shane Barratt|arXiv (Cornell University)|Jan 21, 2020
Reservoir Engineering and Simulation Methods被引用数 10
ひとこと要約

本稿では、カルマン制約を課すことにより、エキスパートのデモンストレーションから線形制御方策を学ぶための新規手法を提案する。この制約により、方策はあるLQR問題に対して最適であることが保証され、安定性が確保される。ADMMに基づく最適化を用いることで、少ないデモンストレーションでも学習が安定し、標準的な方策適合法が不安定性や無限コストに陥るのを避けて、一貫して有限で低コストの方策を達成する。

ABSTRACT

We consider the problem of learning a linear control policy for a linear dynamical system, from demonstrations of an expert regulating the system. The standard approach to this problem is policy fitting, which fits a linear policy by minimizing a loss function between the demonstrations and the policy's outputs plus a regularization function that encodes prior knowledge. Despite its simplicity, this method fails to learn policies with low or even finite cost when there are few demonstrations. We propose to add an additional constraint to policy fitting, that the policy is the solution to some LQR problem, i.e., optimal in the stochastic control sense for some choice of quadratic cost. We refer to this constraint as a Kalman constraint. Policy fitting with a Kalman constraint requires solving an optimization problem with convex cost and bilinear constraints. We propose a heuristic method, based on the alternating direction method of multipliers (ADMM), to approximately solve this problem. Numerical experiments demonstrate that adding the Kalman constraint allows us to learn good, i.e., low cost, policies even when very few data are available.

研究の動機と目的

  • 線形力学系における限られたエキスパートのデモンストレーションから、安定で低コストの線形制御方策を学ぶ課題に対処すること。
  • デモンストレーションが少ない場合に標準的な方策適合法が不安定性や無限コストに陥るのを克服すること。
  • 学習した方策が何らかのLQR問題に対して最適であることを保証するカルマン制約を導入することで、内在的な安定性と耐障害性を確保すること。
  • この制約を方策適合に組み込むための実用的で凸最適化に基づく手法を開発すること。
  • 最小限のデータでも、安定で有限コストの方策を回復できるという本手法の優位性を実証すること。

提案手法

  • 凸コスト関数と双線形(リッカティに基づく)制約を有するバイコン vex最適化問題として、カルマン制約を課した方策適合を定式化する。
  • 非凸問題を近似的に解くためのヒューリスティックとして、交替方向乗数法(ADMM)を用い、凸部分問題を交互に解く。
  • LQR最適性のためのリッカティ方程式の条件を制約として組み込み、方策が何らかの二次コスト関数に対して最適であることを保証する。
  • ノイズや外れ値のあるデモンストレーションに対して耐性を高めるために、ハッバー損失とチホノフ正則化を適用する。
  • コスト関数の変更と時変リッカティ制約を用いることで、有限時間ホライズンおよびトラッキング問題に本手法を拡張する。
  • ADMMを繰り返し適用して最適化問題を解き、計算の tractability を維持する。

実験結果

リサーチクエスチョン

  • RQ1デモンストレーションが少ない状況下で、カルマン制約は線形系における方策学習を改善できるか?
  • RQ2カルマン制約によるLQR最適性の強制は、無限コスト方策を防ぎ、安定性を確保できるか?
  • RQ3少数のデモンストレーションにおいて、本手法は標準的な方策適合法と比べてコストと信頼性の面で優れているか?
  • RQ4ノイズや損傷のあるデモンストレーション(例:外れ値の入力)の下でも、本手法は有効に機能するか?
  • RQ5本手法は、有限時間ホライズンおよびトラッキング制御問題へどの程度一般化可能か?

主な発見

  • カルマン制約を課した方策適合は、すべての実験設定において一貫して有限の期待コストを達成したのに対し、標準的な方策適合法は、少数のデモンストレーション条件下で最大100%のシミュレーションで無限コストに陥った。
  • 航空機制御の例では、10未満のデモンストレーション条件下で、本手法が標準的な方策適合法よりも顕著に低い期待コストを達成した。
  • 5つ以下のデモンストレーション条件下では、標準的な方策適合法が40–60%の試行で安定な方策を生成できなかったが、カルマン制約付き手法は100%のケースで有限コストを維持した。
  • 外れ値を含むLQR実験では、10%の制御入力が反転した状況下でも、本手法は有限のコストと低い期待コストを維持したのに対し、標準的な方策適合法は劣っていた。
  • わずか5つのデモンストレーションでも、本手法はエキスパートと最適方策の性能に近い方策を回復できた。
  • ADMMに基づくアルゴリズムは信頼性高く収束し、勾配ベースのチューニングや広範なハイパーパramータ探索を必要とせずに、安定で低コストの方策を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。