Skip to main content
QUICK REVIEW

[論文レビュー] Adding Neural Network Controllers to Behavior Trees without Destroying Performance Guarantees

Christopher Iliffe Sprague, Petter Ögren|arXiv (Cornell University)|Sep 26, 2018
Explainable Artificial Intelligence (XAI)被引用数 7
ひとこと要約

本稿では、安全性と目的到達の保証を維持したまま、ニューラルネットワーク制御器を行動ツリー(BTs)に統合する手法を提案する。安全性を最優先とし、次にモデルベース制御、最後にデータ駆動型制御の階層的優先順位を採用することで、信頼性の低い機械学習(ML)部品がシステムの安定性や性能を損なうのを防ぐ。インバーテッドペンドulumのスイングアップタスクにおいて、有限時間の安全性と収束性を保証するという点で実証された。

ABSTRACT

In this paper, we show how Behavior Trees that have performance guarantees, in terms of safety and goal convergence, can be extended with components that were designed using machine learning, without destroying those performance guarantees. Machine learning approaches such as reinforcement learning or learning from demonstration can be very appealing to AI designers that want efficient and realistic behaviors in their agents. However, those algorithms seldom provide guarantees for solving the given task in all different situations while keeping the agent safe. Instead, such guarantees are often easier to find for manually designed model-based approaches. In this paper we exploit the modularity of behavior trees to extend a given design with an efficient, but possibly unreliable, machine learning component in a way that preserves the guarantees. The approach is illustrated with an inverted pendulum example.

研究の動機と目的

  • 信頼性の低いデータ駆動型制御器を自律システムに統合する際、安全性や目的到達の保証を損なわないようにする。
  • 手動で設計されたモデルベースBTに機械学習部品を拡張する際、形式的な性能保証(安全性および有限時間収束)を維持する。
  • 効率的な学習された行動を可能にしつつ、システム全体の正しさを保つ、モジュール型で再構成可能なフレームワークを提供する。
  • ML部品を含むハイブリッドBTが、制御器の競合やデッドロックを避けるための条件を形式的に定式化する。
  • インバーテッドペンドulumのスイングアップタスクという代表的な制御問題に対して、このアプローチを実証する。

提案手法

  • BTアーキテクチャは、三段階の優先順位で構造化されている:最高優先度の安全制御器、中程度のモデルベース制御器、最低優先度のデータ駆動型(ニューラルネットワーク)制御器。
  • 安全制御器は、システムが事前に定義された危険領域に入ると活性化され、安定性を確保するための正の不変集合を用いたPD型制御則が適用される。
  • 走行コスト(例:時間またはエネルギー)がしきい値を超えると、モデルベース制御器が起動され、目的領域への有限時間収束が保証される。
  • データ駆動型制御器は、安全制御とコスト制約の両方が満たされた場合にのみ実行され、リスク露出を最小限に抑える。
  • スイッチング下でのシステム動作を保証するため、ラプラシアンに基づく安定性理論と有限時間安全性(FTS)解析を用いて、形式的な条件を導出する。
  • データ駆動型制御器は、ポントレヤーギンの最大原理から得た最適軌道を用いて行動クラーニングで学習され、3層のMLP(ソフトプラスおよびtanh活性化関数を用いる)で実装される。

実験結果

リサーチクエスチョン

  • RQ1どのような条件下で、ニューラルネットワーク制御器を行動ツリーに安全に統合できるか? その際、安全性や収束保証が損なわれない。
  • RQ2行動ツリーの反応性とモularityを活用することで、ハイブリッド制御システムにおける制御器の競合をどのように回避できるか?
  • RQ3安全制御、モデルベース制御、データ駆動型制御の組み合わせが、有限時間安全性および目的到達の両方を保証するための形式的条件は何か?
  • RQ4最適軌道に基づいて学習されたデータ駆動型制御器を、ハイブリッドBTフレームワークで安全に使用できるか? その際、システム全体の性能保証が維持されるか?
  • RQ5走行コストを、データ駆動型制御器からモデルベース制御器にスイッチするためのトリガーとして用いる場合、形式的に正しい方法で切り替えるにはどうすればよいか?

主な発見

  • 階層的優先順位を採用した提案されたBT構造により、正の不変集合とラプラシアン解析を用いた有限時間安全性(FTS)が保証される。
  • モデルベース制御器は、安定性理論とシステムダイナミクス解析を用いて、目的領域への有限時間収束を保証する。
  • データ駆動型制御器は、未学習の軌道において、テスト時の平均二乗誤差(MSE)が2.2745e-3に達し、学習分布上での優れた性能を示した。
  • システム全体として、すべての必要な性能保証が満たされている:安全性が維持され、定義されたスイッチング論理のもとで目的到達が保証される。
  • 厳密な優先順位と形式的なスイッチング条件を採用することで、デッドロックや制御器の競合が効果的に防止された。
  • インバーテッドペンドulumの例では、ハイブリッドBT設計が、信頼性の低いエッジケースでも安全な運用と効率的なスイングアップ性能を両立していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。