Skip to main content
QUICK REVIEW

[論文レビュー] A Learnable Safety Measure

Steve Heim, Alexander von Rohr|arXiv (Cornell University)|Oct 7, 2019
Gaussian Processes and Bayesian Inference参考文献 26被引用数 4
ひとこと要約

本稿では、失敗状態に対するシステムダイナミクスを暗黙的に捉える学習可能で安全な措置を提案し、ガウス過程のアクティブサンプリングを用いてモデルフリーな安全な探索を可能にする。この手法は、有効な状態-行動ペアの確率的推定を学習し、正確なシステムモデルや失敗境界の事前知識を必要とせず、500サンプル経過後に失敗率を8%削減する。

ABSTRACT

Failures are challenging for learning to control physical systems since they risk damage, time-consuming resets, and often provide little gradient information. Adding safety constraints to exploration typically requires a lot of prior knowledge and domain expertise. We present a safety measure which implicitly captures how the system dynamics relate to a set of failure states. Not only can this measure be used as a safety function, but also to directly compute the set of safe state-action pairs. Further, we show a model-free approach to learn this measure by active sampling using Gaussian processes. While safety can only be guaranteed after learning the safety measure, we show that failures can already be greatly reduced by using the estimated measure during learning.

研究の動機と目的

  • 正確な有効領域の計算を必要とせず、失敗状態に対するシステムダイナミクスを暗黙的に符号化する安全措置の開発。
  • 正確なダイナミクスモデルが入手できない状況下でも、失敗が高コストだが致命的でない物理系における安全な探索の実現。
  • ガウス過程を用いたアクティブサンプリングにより、事前知識に依存しない有効な状態-行動集合の確率的推定を学習すること。
  • 収束前でさえ、推定された安全措置をガイドとして用いることで、学習中の失敗率を低減すること。
  • 従来の有効領域計算に代わるスケーラブルでモデルフリーな代替手法を提供し、高コストな工学的作業とモデルの不正確さを回避すること。

提案手法

  • 安全措置は、有効な状態-行動ペアの集合における有効性の積分として定義され、失敗状態に進入しない「操作の余地」を定量化する。
  • ガウス過程を用いて安全措置をモデル化し、低精度のシミュレーションと既知の運転点から得られる事前分布を用いて収束性を向上させる。
  • アクティブサンプリングにより、不確実性と安全推定の改善可能性に基づいて新たな状態-行動ペアを選択し、信頼区間のγ_optおよびγ_cautを用いる。
  • アルゴリズムは、GPの滑らかさ仮定を尊重しながら、失敗状態を避けることで安全措置を段階的に精緻化し、有効な集合を同定する。
  • 状態-行動空間における有効性の定式化を用い、ある状態-行動ペアから出発した場合に無限に失敗を回避できる場合に限り、そのペアを有効と定義する。
  • 探索と安全のバランスを、高リスク領域における不確実性低減を優先しつつ、失敗発生数を最小限に抑えることで実現する。

実験結果

リサーチクエスチョン

  • RQ1正確なシステムダイナミクスモデルを必要とせず、データから直接安全措置を学習することは可能か?
  • RQ2ガウス過程を用いたモデルフリーなアプローチは、失敗が高コストなシステムにおいてどのように安全な探索を可能にするか?
  • RQ3推定された安全措置は、収束前でも学習中の失敗率をどの程度低減できるか?
  • RQ4γ_opt、γ_caut、λなどの調整パラメータは、学習された有効集合の正確性と保守性にどのように影響するか?
  • RQ5GPの滑らかさ仮定は、非滑らかな失敗境界付近での学習性能にどのような影響を及えるか?

主な発見

  • 提案された安全措置は、各状態-行動ペアから利用可能な安全行動の数を定量化することで、システムの有効性を効果的に捉えている。
  • 500サンプル経過後、SLIPモデルでは8%の失敗率を達成し、学習中の失敗が顕著に低減された。
  • 非滑らかな失敗境界付近でさえも、アルゴリズムは有効集合を正しく学習できたが、滑らかさ仮定の破れのため、より多くのサンプルを要した。
  • 低精度シミュレーションから導出された事前共分散関数は、モデルの不正確さにもかかわらず、特に適切に選ばれた運転点と組み合わせることで、収束を迅速化した。
  • 保守的でありながらもほぼ最大の有効集合の近似を達成しており、事前分布の不正確さに対してロバストであり、アクティブサンプリングの有効な活用が示された。
  • 従来のモデルベースの有効領域計算が非現実的であるような、複雑で高次元のシステムに対しても、安全な学習が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。