Skip to main content
QUICK REVIEW

[論文レビュー] Learning Constraints from Demonstrations

Glen Chou, Dmitry Berenson|arXiv (Cornell University)|Dec 17, 2018
Fault Detection and Control Systems参考文献 30被引用数 17
ひとこと要約

本稿では、安全なデモ、システムダイナミクス、コスト関数を用いて、ロボットタスク間で共有される未知の制約を学習する手法を提案する。デモから低コスト(非安全)な軌道をサンプリングし、逆整数計画法を用いることで、非安全領域の保証された下近似を回復する。この手法は線形および非線形ダイナミクスに一般化可能であり、特徴空間へと拡張可能である。

ABSTRACT

We extend the learning from demonstration paradigm by providing a method for learning unknown constraints shared across tasks, using demonstrations of the tasks, their cost functions, and knowledge of the system dynamics and control constraints. Given safe demonstrations, our method uses hit-and-run sampling to obtain lower cost, and thus unsafe, trajectories. Both safe and unsafe trajectories are used to obtain a consistent representation of the unsafe set via solving an integer program. Our method generalizes across system dynamics and learns a guaranteed subset of the constraint. We also provide theoretical analysis on what subset of the constraint can be learnable from safe demonstrations. We demonstrate our method on linear and nonlinear system dynamics, show that it can be modified to work with suboptimal demonstrations, and that it can also be used to learn constraints in a feature space.

研究の動機と目的

  • 複数のロボットタスク間で共有される潜在的制約を明示的なプログラミングなしに学習する課題に対処すること。
  • 安全なデモと既知のシステムダイナミクスのみを用いて、ロボットが異なるタスク間で安全制約を一般化できるようにすること。
  • 安全なデモから真の非安全領域の部分集合が保証的に回復されることを理論的に裏付けた手法を提供すること。
  • 状態空間や軌道空間にとどまらず、移動ロボットのナビゲーションにおける地形勾配のような抽象的特徴空間への制約学習を拡張すること。
  • 人間の行動に起因する非最適なデモに対応するため、確率的セーフティラベルを導入することで、現実世界の行動へのロバストネスを向上させること。

提案手法

  • 安全で最適なデモを用いて、ヒットアンドランサンプリングにより、未知の制約に違反すると仮定して低コストの軌道を生成する。
  • サンプリングされた軌道が既知の制約(ダイナミクス、制御制限、開始/終了条件)を満たすように保証し、実行可能性を維持する。
  • 安全および非安全な軌道を用いて、非安全領域の一貫した表現を推定する逆整数計画問題を定式化する。
  • 非安全領域を、状態空間、特徴空間、または軌道空間などの離散化された制約空間における超長方形の和集合として表現する。
  • 軌道の離散化、ダイナミクス、デモのカバー範囲に基づいて、学習可能性の限界を理論的に分析する。
  • 非最適なデモに対応するため、デモに対するコスト比に基づいて軌道に確率的セーフティラベルを割り当てる。

実験結果

リサーチクエスチョン

  • RQ1システムダイナミクスとコスト関数が与えられたもとで、安全で最適なデモから、非安全制約のどの部分を信頼性高く学習できるか?
  • RQ2状態空間や軌道空間にとどまらず、地形勾配のような特徴空間(例:地形勾配)において制約をどのように学習できるか?
  • RQ3本手法は、ダブルインテグレータやダブルスの車両のような線形および非線形ダイナミクスを含むさまざまなシステムダイナミクスに一般化可能か?
  • RQ4非最適な人間のデモに対して本手法はどのように対処し、学習された制約の正確性にどのような影響を与えるか?
  • RQ5真の非安全領域の下近似に関して理論的保証は何か? そして、軌道の離散化とデモの多様性にどのように依存するか?

主な発見

  • 本手法は、単一および二重積分器のダイナミクスにおいて、たった数個のデモでのみ、真の非安全領域の保証された下近似を回復できた。
  • ダブルスの車両モデルにおいて、本手法は非安全領域の顕著な部分を回復し、デモの多様性が増すほど性能が向上した。
  • 非最適なデモ実験においても、理論的保証が維持され、確率的ラベリングにもかかわらず、学習された非安全領域は真の非安全領域の部分集合のままだった。
  • 特徴空間における地形勾配制約を正確に回復した。1つのRRT*-生成デモから、閾値 $φ(x) < 0.05$ を学習した。
  • 学習性能は、軌道の離散化とデモのカバー範囲によって制限され、高コスト領域を通過する短絡路がない領域は学習されなかった。
  • 非最適な設定ではラベリングの不確実性のためMSEが増加したが、依然として有効で保守的な非安全領域の下近似を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。