Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Vulnerabilities of Deep Neural Policies

Ezgi Korkmaz|arXiv (Cornell University)|Aug 30, 2021
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

この論文は、2つの手法を用いて入力の摂動に対する脆弱性を分析することで、敵対的訓練が強化学習における深層ニューラル方策に与える影響を調査する。1つは敵対的摂動の周波数ドメイン解析、もう1つは新しい特徴感受性プロービング技術である。その結果、敵対的訓練を受けた方策は低周波数摂動に対してより感受性を示し、元の非頑健な特徴から新たな非頑健な特徴へと脆弱性が移行することが判明し、頑健性の特性に根本的な変化が生じていることが示された。

ABSTRACT

Reinforcement learning policies based on deep neural networks are vulnerable to imperceptible adversarial perturbations to their inputs, in much the same way as neural network image classifiers. Recent work has proposed several methods to improve the robustness of deep reinforcement learning agents to adversarial perturbations based on training in the presence of these imperceptible perturbations (i.e. adversarial training). In this paper, we study the effects of adversarial training on the neural policy learned by the agent. In particular, we follow two distinct parallel approaches to investigate the outcomes of adversarial training on deep neural policies based on worst-case distributional shift and feature sensitivity. For the first approach, we compare the Fourier spectrum of minimal perturbations computed for both adversarially trained and vanilla trained neural policies. Via experiments in the OpenAI Atari environments we show that minimal perturbations computed for adversarially trained policies are more focused on lower frequencies in the Fourier domain, indicating a higher sensitivity of these policies to low frequency perturbations. For the second approach, we propose a novel method to measure the feature sensitivities of deep neural policies and we compare these feature sensitivity differences in state-of-the-art adversarially trained deep neural policies and vanilla trained deep neural policies. We believe our results can be an initial step towards understanding the relationship between adversarial training and different notions of robustness for neural policies.

研究の動機と目的

  • 敵対的訓練が強化学習における深層ニューラル方策の脆弱性プロファイルにどのように影響を与えるかを理解すること。
  • 敵対的訓練が分布的シフトの異なるタイプ、特に周波数ドメインにおいて頑健性をどのように再配分するかを調査すること。
  • 敵対的訓練が元の非頑健な特徴の感受性を排除すると同時に、新たな非頑健な特徴を導入するかどうかを特定すること。
  • 深層ニューラル方策における特徴レベル感受性を測定するための新規手法を開発・適用すること。
  • 複数のAtari環境において、最先端の敵対的訓練済みおよび通常訓練済み深層ニューラル方策の頑健性特性を比較すること。

提案手法

  • 論文は、CarliniとWagnerの攻撃によって生成された最小の敵対的摂動の周波数ドメインを、フーリエ変換を用いて分析する。この分析は、敵対的訓練済みおよび通常訓練済みの両方の方策に適用される。
  • KMAP(カーネルベースのモデル活性プロービング)を導入し、個々の画素摂動が方策出力に与える影響を計算することで、特徴感受性を測定する。
  • HMAP(ヘッシアンベースのモデル活性プロービング)を提案し、摂動の前後におけるソフトマックス方策分布の差を用いて感受性を推定する。
  • KMAPおよびHMAPを用いて、OpenAI GymのAtari環境で訓練された深層ニューラル方策における感受性パターンを評価する。
  • ℓ₁/ℓ₂ノルム比およびソフトマックス変換された感受性マップのエントロピーを用いて、脆弱性パターンのスパarsityと分布的広がりを定量的に評価する。
  • 実験は、Freeway、BankHeist、RoadRunner、Pongの4つのAtariゲームで実施され、通常訓練済みと敵対的訓練済みエージェントが比較される。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練は、深層ニューラル方策における最小の敵対的摂動の周波数分布にどのように影響を与えるか?
  • RQ2敵対的訓練済みと通常訓練済みの深層ニューラル方策における特徴レベル感受性にどのような差があるか?
  • RQ3敵対的訓練は、元の非頑健な特徴に対する感受性を排除すると同時に、新たな非頑健な特徴を導入するか?
  • RQ4敵対的訓練済み方策の脆弱性パターンは、通常方策と比較してスパarsityおよび分布的広がりの観点でどのように異なるか?
  • RQ5KMAPおよびHMAPは、深層ニューラル方策における特徴ベースの脆弱性を信頼性高くかつ明確に測定できるか?

主な発見

  • 敵対的訓練済み方策は、通常訓練済み方策と比較して、フーリエドメインにおける低周波成分に集中した敵対的摂動を示す。
  • KMAP法により、敵対的訓練済み方策はスパースな脆弱性パターンを示すことが判明し、S(𝒦)値がFreeway(通常)の53.73から敵対的訓練済みの20.46に低下した。これは多くの特徴に対する感受性の低下を示している。
  • HMAPの結果は混合的であり、敵対的訓練済み方策のS(𝒦)値は顕著に低下(例:BankHeistで38.41から4.88に)したが、一部のケースではエントロピー値が高く保たれ、スパースネスのシフトが限定的にしか検出されない可能性を示唆している。
  • エントロピー解析により、敵対的訓練済み方策のKMAPベースの感受性マップは、通常方策(8.8287)と比較してはるかに低いエントロピー(例:Freewayで0.0807)を示し、より局所的かつスパースな脆弱性を示している。
  • 一部の元の非頑健な特徴に対する感受性を排除したにもかかわらず、敵対的訓練は新たな非頑健な特徴を導入しており、KMAPおよびHMAPにおける明確で局所的な感受性パターンの出現によって裏付けられている。
  • 結果として、明白な脆弱性のシフトが示された。敵対的訓練は頑健性の問題を完全に排除するのではなく、特に低周波成分および新たな特徴セットへと脆弱性を再配分している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。