Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Reinforcement Learning for Observer Design in Autonomous Systems under Cyber Attacks

Abhishek Gupta, Zhaoyuan Yang|arXiv (Cornell University)|Sep 15, 2018
Adversarial Robustness in Machine Learning参考文献 9被引用数 8
ひとこと要約

本稿では、敵対的センサー攻撃を検出・是正するため、モデルフリーの観測者設計を提案する。敵対的深層強化学習を用いて、最小最大フレームワーク内で信頼領域方策最適化(TRPO)によりニューラルネットワークの観測者を訓練することで、摂動を受ける高次元測定値を真の状態多様体に戻す能力を学習する。これにより、有界な敵対的ノイズ下でもほぼ最適な制御性能を達成する。

ABSTRACT

Complex autonomous control systems are subjected to sensor failures, cyber-attacks, sensor noise, communication channel failures, etc. that introduce errors in the measurements. The corrupted information, if used for making decisions, can lead to degraded performance. We develop a framework for using adversarial deep reinforcement learning to design observer strategies that are robust to adversarial errors in information channels. We further show through simulation studies that the learned observation strategies perform remarkably well when the adversary's injected errors are bounded in some sense. We use neural network as function approximator in our studies with the understanding that any other suitable function approximating class can be used within our framework.

研究の動機と目的

  • 正確なシステムモデルが入手できない状況において、自律システムのロバストな観測者を設計する課題に対処すること。
  • 測定値を汚染する敵対的センサー攻撃を検出し是正するためのモデルフリー枠組みを開発すること。
  • システムの真の状態を、データのみを用いて汚染された高次元測定値から再構築できるように観測者を設計すること。
  • システム性能を低下させるために有界なノイズを注入する戦略的敵対者に対して耐性を持つこと。
  • 敵対的強化学習が、固定または恒等写像の観測者を上回る性能を示す観測者を訓練できることを実証すること。

提案手法

  • 汚染された測定値から真の状態多様体へのマッピングを学習するために、深層ニューラルネットワークを関数近似器として用いる。
  • 観測者設計を2人零和ゲームとして定式化する:観測者は推定誤差を最小化し、敵対者はそれを最大化する。
  • 安定的かつ単調に改善するためのKLダイバージェンス制約を課した信頼領域方策最適化(TRPO)を用いて、観測者方策を訓練する。
  • 15,000ステップごとに反復処理において、敵対者と観測者の交互更新および同時更新を実装する。
  • 敵対的ノイズの境界を±2σ、±4σ、±8σとして定義し、攻撃強度の増大に対する耐性を評価する。
  • 測定値(cosθ, sinθ)が単位円上に位置し、2次元空間における1次元非線形多様体を形成する倒立振子系を実験台として用いる。

実験結果

リサーチクエスチョン

  • RQ1敵対的強化学習を用いて訓練されたデータ駆動型観測者は、システムモデルの事前知識がなくても、汚染されたセンサー測定値から真の状態を効果的に再構築できるか?
  • RQ2敵対的ノイズの大きさが訓練時の境界を超えて増大する際、観測者の性能はどのように低下するか?
  • RQ3適応的敵対者を伴う最小最大設定で訓練された観測者は、固定観測者または恒等写像の観測者と比較して、攻撃下で優れた性能を示すか?
  • RQ4敵対者が有界で戦略的なノイズを注入する状況下で、観測者がほぼ最適な制御性能をどれほど回復できるか?
  • RQ5フィクティブプレイにおける逐次的更新と同時更新の違いが、観測者-敵対者トレーニングプロセスの収束性と安定性に与える影響はいかほどか?

主な発見

  • 敵対的ノイズが±2σの範囲内に制限されている場合、観測者は汚染された測定値を真の状態多様体に戻す能力を効果的に学習し、ほぼ最適な制御性能を回復する。
  • 観測者が訓練された後、1000ステップの累積報酬が約80に達する。これは最大値に近く、効果的な状態回復を示している。
  • 訓練された観測者が存在しない場合、敵対者は急速にシステム性能を低下させ、報酬が約-80にまで下がる。これは、是正策なしに攻撃が与える深刻な影響を示している。
  • より大きなノイズ境界(±8σ)では、観測者が汚染を逆転できず、システム性能が著しく低下する。これは、極端な攻撃に対して本手法の耐性に限界があることを示している。
  • 観測者は正確な元の状態を計算する必要はない。むしろ、汚染されていない状況と同様の行動を制御者が取るような推定値を出力するだけで十分である。
  • トレーニング中に報酬曲線に急激な変化が見られるのは、1つのエージェントが強力な最適応答戦略を学習したためであり、最小最大ゲームにおける動的適応を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。