Skip to main content
QUICK REVIEW

[論文レビュー] Safe Interactive Model-Based Learning

Marco Gallieri, Seyed Sina Mirrazavi Salehian|arXiv (Cornell University)|Nov 15, 2019
Advanced Control Systems Optimization参考文献 57被引用数 10
ひとこと要約

本稿では、安全な探索を実現するモデル予測制御(MPC)を用いて、安全なコントローラーとベイジアンRNN前方モデルを段階的に改善する、安全なインタラクティブなモデルベース学習(SiMBL)フレームワークを提案する。ラプラウシン関数、不確実性を考慮したモデル、一貫性の事前分布を統合することで、形式的な安全保証が可能となり、安全領域が段階的に拡大される。限られたトルクと非凸制約を持つ倒立振子において実証された。

ABSTRACT

Control applications present hard operational constraints. A violation of these can result in unsafe behavior. This paper introduces Safe Interactive Model Based Learning (SiMBL), a framework to refine an existing controller and a system model while operating on the real environment. SiMBL is composed of the following trainable components: a Lyapunov function, which determines a safe set; a safe control policy; and a Bayesian RNN forward model. A min-max control framework, based on alternate minimisation and backpropagation through the forward model, is used for the offline computation of the controller and the safe set. Safety is formally verified a-posteriori with a probabilistic method that utilizes the Noise Contrastive Priors (NPC) idea to build a Bayesian RNN forward model with an additive state uncertainty estimate which is large outside the training data distribution. Iterative refinement of the model and the safe set is achieved thanks to a novel loss that conditions the uncertainty estimates of the new model to be close to the current one. The learned safe set and model can also be used for safe exploration, i.e., to collect data within the safe invariant set, for which a simple one-step MPC is proposed. The single components are tested on the simulation of an inverted pendulum with limited torque and stability region, showing that iteratively adding more data can improve the model, the controller and the size of the safe region.

研究の動機と目的

  • 厳密な運用制約が課される現実環境における、システムモデルとコントローラーの安全でインタラクティブな学習を可能にするフレームワークの開発。
  • 訓練データ外の不確実性を推定するためのノイズコントラスト的事前分布(NPC)に基づく確率的手法を用いて、安全保証を形式的に検証すること。
  • 新たな不確実性推定値を過去の推定値に条件づけることで、安全領域とモデルを段階的に改善し、耐性とカバー範囲を向上させること。
  • 学習済みの不変安全領域内に制限された1ステップMPC戦略を用いて、安全な探索を実現すること。
  • モデル、ポリシー、安全保証を統合した一元的で学習可能なパイプラインを構築し、実データを用いた連続的改善を可能にすること。

提案手法

  • 訓練分布外の状態における状態遷移不確実性を推定するために、ノイズコントラスト的事前分布を備えたベイジアンRNN前方モデル(NCP-BRNN)を定式化する。
  • 前方モデルのバックプロパゲーションと交互最小化に基づく最小最大化制御フレームワークを用い、安全な制御ポリシーとラプラウシン関数を同時に学習する。
  • 新たなモデルの不確実性を過去のモデルの不確実性に条件づける、新規の一貫性損失を採用し、安定した段階的改善を実現する。
  • 加法的状態不確実性推定値を用いた確率的安全保証手法を導入し、高い確率で安全を保証する。
  • 学習済みのラプラウシン関数と安全領域を活用し、不変安全領域内での探索をガイドする1ステップMPC戦略を適用する。
  • 既知のシステムダイナミクスを微分可能に組み込むために、グレイボックスアーキテクチャを用いてRNNに物理的事前知識を統合する。

実験結果

リサーチクエスチョン

  • RQ1運用制約が存在する状況下で、モデルベース強化学習フレームワークが段階的学習中にどのように安全を確保できるか。
  • RQ2ノイズコントラスト的事前分布を備えたベイジアンRNNは、訓練データ外の状態において不確実性を信頼性高く推定でき、形式的安全保証を支援できるか。
  • RQ3データ収集中に安全を維持しつつ、安全領域とコントローラーをどのように段階的に改善できるか。
  • RQ4MPCを用いた安全な探索によって、安全領域はどの程度拡大され、時間経過とともにモデル精度はどのように向上するか。
  • RQ5不確実性推定値に一貫性事前分布を適用することで、モデルと安全領域の安定的かつ段階的改善が可能になるか。

主な発見

  • フレームワークは、非凸な安全領域内で漸近的安定性を保証するラプラウシン関数と安全な制御ポリシーをシミュレーションで正しく学習した。
  • 安全なMPCによる段階的データ収集により、学習済みの安全領域のサイズが拡大され、安全カバー範囲の段階的向上が実証された。
  • ノイズコントラスト的事前分布を備えたベイジアンRNNは、訓練分布外の状態で大きな不確実性推定値を生成し、効果的な安全保証を可能にした。
  • 一貫性損失により、新たなモデルの不確実性推定値が過去の推定値と整合的を保ち、改善プロセスの安定化が達成された。
  • 1ステップMPCに基づく安全な探索戦略は、不変安全領域内でのデータ収集に成功し、連続的なモデルおよびポリシーの改善を可能にした。
  • モデルの不確実性や非凸制約が存在する状況下でも、高い確率で形式的安全保証が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。