Skip to main content
QUICK REVIEW

[論文レビュー] Verification in the Loop: Correct-by-Construction Control Learning with Reach-avoid Guarantees

Yixuan Wang, Chao Huang|arXiv (Cornell University)|Jun 6, 2021
Machine Learning and Algorithms参考文献 32被引用数 5
ひとこと要約

本論文は、安全確保が求められるシステムにおける到達・回避特性を保証するために、形式的検証を設計プロセスに統合したクローズドループ制御学習フレームワークを提案する。到達可能集合の計算を用いてフィードバックメトリクス(幾何的距離およびワッサーシュタイン距離)を構築し、微分可能な最適化問題として定式化し、近似勾配降下法を適用することで、形式的検証が保証された安全かつ目的到達可能な制御則を学習する。従来手法に比べ、収束性と安全性の両面で優れた性能を発揮する。

ABSTRACT

In the current control design of safety-critical autonomous systems, formal verification techniques are typically applied after the controller is designed to evaluate whether the required properties (e.g., safety) are satisfied. However, due to the increasing system complexity and the fundamental hardness of designing a controller with formal guarantees, such an open-loop process of design-then-verify often results in many iterations and fails to provide the necessary guarantees. In this paper, we propose a correct-by-construction control learning framework that integrates the verification into the control design process in a closed-loop manner, i.e., design-while-verify. Specifically, we leverage the verification results (computed reachable set of the system state) to construct feedback metrics for control learning, which measure how likely the current design of control parameters can meet the required reach-avoid property for safety and goal-reaching. We formulate an optimization problem based on such metrics for tuning the controller parameters, and develop an approximated gradient descent algorithm with a difference method to solve the optimization problem and learn the controller. The learned controller is formally guaranteed to meet the required reach-avoid property. By treating verifiability as a first-class objective and effectively leveraging the verification results during the control learning process, our approach can significantly improve the chance of finding a control design with formal property guarantees. This is demonstrated via a set of experiments on both linear and non-linear systems that use model-based or neural network based controllers.

研究の動機と目的

  • 安全制御システムにおける従来のオープンループ設計・検証アプローチの限界を解消すること。
  • 形式的検証を制御学習プロセスに直接統合することで、反復的設計サイクルを短縮すること。
  • モデルベースおよびニューラルネットワークベースの制御則に対し、到達・回避特性(安全性および目的到達)の形式的保証を可能にすること。
  • 検証結果(到達可能集合)をフィードバックとして活用し、制御則パラメータのチューニングを誘導するフィードバック機構を構築すること。
  • 標準的な強化学習およびモデルベース制御手法に比べ、収束性と安全性の両面での性能向上を実現すること。

提案手法

  • 検証モジュールを用いて、制御則パラメータ下でのシステム状態の過剰近似到達可能集合を計算する。
  • 2つのフィードバックメトリクスを構築する:1つは非安全領域および目的領域からの幾何的距離に基づくもので、もう1つは状態分布間のワッサーシュタイン距離に基づくものである。
  • フィードバックメトリクスの最小化を目的とした最適化問題を定式化し、安全違反の可能性や目的到達の欠落の度合いを表す。
  • 有限差分法を用いた近似勾配降下アルゴリズムを用いて、制御則パラメータを反復的にチューニングする。
  • 線形制御則(例:LQR)およびニューラルネットワークベースの制御則(例:DDPG)の両方に対して、各ステップで検証を実施する。
  • 高リプシッツ定数を持つニューラルネットワーク制御則における過剰近似問題を軽減するため、ハイブリッド制御則学習戦略を導入する。

実験結果

リサーチクエスチョン

  • RQ1形式的検証の結果を制御学習のフィードバック信号として効果的に活用することで、安全性の保証を向上させることができるか?
  • RQ2到達可能集合の計算をどのように活用して、制御則パラメータ最適化のための微分可能なメトリクスを構築できるか?
  • RQ3検証を設計段階に統合するクローズドループ設計・検証フレームワークは、従来の設計・検証分離型のオープンループアプローチに比べ、より信頼性の高い形式的到達・回避保証を達成できるか?
  • RQ4フィードバックメトリクスの選択(幾何的距離対ワッサーシュタイン距離)が収束性および安全性の性能に与える影響は何か?
  • RQ5学習ループにおける検証のきつさ(tightness)と計算コストのトレードオフは何か?

主な発見

  • 提案手法は、線形ACCおよび非線形ヴァン・デル・ポール発振子系の両方で、100%の安全制御および目的到達率を達成し、DDPGおよびLQRベースラインを上回った。
  • 発振子系では、提案手法は55–65イテレーション(±13, ±4)で収束し、完全な安全性と目的到達を達成したが、DDPGは13.7Kイテレーションを要し、目的到達率は79.2%にとどまり、形式的検証は行われなかった。
  • 提案手法で学習された制御則は、幾何的距離およびワッサーシュタイン距離の両メトリクスにおいて、形式的検証により到達・回避が保証された。一方、DDPG制御則は過剰近似の問題により検証が行われなかった。
  • よりきつい検証(1ステップあたり40ステップ)は計算時間を延長(1ステップあたり115秒)したが、精度が向上した。一方、緩い検証(1ステップあたり55ステップ)は時間は短縮(1ステップあたり86秒)されたが、精度はやや低下した。
  • ハイブリッド制御則学習戦略により、高リプシッツ定数を持つニューラルネットワーク制御則における過剰近似誤差が、回避と目的到達のフェーズにタスクを分解することで効果的に軽減された。
  • フレームワークは線形および非線形システムの両方で高いロバストネスを示し、5回の独立実験において収束および性能指標の標準偏差が低く、一貫した性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。