[論文レビュー] Verification of Neural Network Control Policy Under Persistent Adversarial Perturbation
本稿では、静的ニューラルネットワーク認証ツールとロバスト制御理論を組み合わせることで、恒続的 $ε$-有界 $ℓ_{\infty}$ アドバーシャル摂動下におけるニューラルネットワーク制御方策の検証に向けた新規フレームワークを提案する。正の不変集合を計算するアルゴリズムを導入し、制御方策のリプシッツ連続性や微分可能性を必要とせず、カートポール制御タスクにおいて従来のリプシッツベースの手法に比べて5倍の高い認証境界を達成する。
Deep neural networks are known to be fragile to small adversarial perturbations. This issue becomes more critical when a neural network is interconnected with a physical system in a closed loop. In this paper, we show how to combine recent works on neural network certification tools (which are mainly used in static settings such as image classification) with robust control theory to certify a neural network policy in a control loop. Specifically, we give a sufficient condition and an algorithm to ensure that the closed loop state and control constraints are satisfied when the persistent adversarial perturbation is l-infinity norm bounded. Our method is based on finding a positively invariant set of the closed loop dynamical system, and thus we do not require the differentiability or the continuity of the neural network policy. Along with the verification result, we also develop an effective attack strategy for neural network control systems that outperforms exhaustive Monte-Carlo search significantly. We show that our certification algorithm works well on learned models and achieves 5 times better result than the traditional Lipschitz-based method to certify the robustness of a neural network policy on a cart pole control problem.
研究の動機と目的
- 閉ループシステムにおけるニューラルネットワーク制御方策が恒続的アドバーシャル摂動に対して脆弱であるという重要な安全性の懸念に対処すること。
- 元々画像分類を想定して設計された静的ニューラルネットワーク認証ツールを、フィードバック結合を持つ動的制御設定に拡張すること。
- リプシッツ連続でない、不連続なニューラルネットワーク制御方策に対しても機能する認証フレームワークを開発すること。
- 提示された攻撃アルゴリズムによって特定された脆弱性を、網羅的モンテカルロシミュレーションでは検出できないことを示すことによって、数学的検証の必要性を実証すること。
- データ駆動型モデル学習と不確実性の境界付与を用いて、システムの動的特性が未知、不安定、非線形であっても、ロバスト性の認証を可能にすること。
提案手法
- 静的ニューラルネットワーク認証ツール(例:[8–13])を活用し、$ℓ_{\infty}$-有界摂動下におけるニューラルネットワーク方策の入出力挙動のタイトな上界近似を計算する。
- 認証済みの入出力マップをロバスト制御理論と統合し、閉ループ力学系の正の不変集合を計算する。
- 名目線形時不変(LTI)モデル $Π$ と、収集されたロールアウトからブートストラップサンプリングによって得られるモデル誤差の保守的境界 $Δ$ を用いて、不確実なシステム動的特性を表現する。
- 不変集合の原則を適用することで、認証済みの安全領域内から出発するすべての軌道が、恒続的アドバーシャル入力のもとで有界に保たれることを保証する。
- 網羅的モンテカルロシミュレーションでは発見できない脆弱性を特定するための新規 $ℓ_{\infty}$-ノルム恒続的攻撃アルゴリズムを採用する。
- アルゴリズム1を設計し、制御方策の微分可能性や連続性を要件としない、不変集合上の凸最適化問題を解くことで、認証済みの安全領域を計算する。
実験結果
リサーチクエスチョン
- RQ1静的ニューラルネットワーク認証ツールは、恒続的アドバーシャル摂動下における閉ループ力学系の制御方策の検証に効果的に拡張可能か?
- RQ2リプシッツ連続でない、または不連続な制御行動が存在する状況において、ニューラルネットワーク方策のロバスト性をどのように認証できるか?
- RQ3数学的認証フレームワークは、網羅的シミュレーションベースの手法が失敗する脆弱性を検出可能か?
- RQ4本手法は、従来のリプシッツベースのロバスト制御アプローチに比べて、認証のタイトさの観点でどの程度優れているか?
- RQ5真のシステム動的特性が未知、不安定、非線形であっても、本フレームワークはどの程度有効か?
主な発見
- 提案された認証アルゴリズムは、カートポール制御問題において、従来のリプシッツベースの手法に比べて5倍の高いロバストネス境界を達成し、優れたタイトさを示した。
- 本フレームワークは、量子化された制御出力を有するようなリプシッツ連続でない、不連続なニューラルネットワーク制御方策に対しても、安全な認証を成功裏に実施した。リプシッツベースの手法では失敗する状況でも有効である。
- 未知の動的特性を持つ学習済みモデルにおいて、100エピソード分のデータで学習した場合、真の線形化モデルの性能に非常に近い認証性能を達成した。
- 開発された $ℓ_{\infty}$ 攻撃アルゴリズムは、網羅的モンテカルロシミュレーションでは検出できないニューラルネットワーク制御システムの脆弱性を発見した。
- システム動的特性が不安定または非線形であっても、データ駆動型手法によって保守的なモデル不確実性境界 $Δ$ が計算されれば、認証フレームワークは依然として有効である。
- アルゴリズム1によって計算された不変集合は、制御方策の微分可能性を要件としない、恒続的アドバーシャル摂動下における閉ループシステムの厳密な安全証明を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。