Skip to main content
QUICK REVIEW

[論文レビュー] A Formalization of Robustness for Deep Neural Networks

Tommaso Dreossi, Shromona Ghosh|arXiv (Cornell University)|Mar 24, 2019
Adversarial Robustness in Machine Learning参考文献 34被引用数 16
ひとこと要約

この論文は、形式的手法を用いて深層ニューラルネットワークのロバストネスを統一的に定式化し、敵対的入力生成をシステム、環境、仕様の3要素を有する検証問題として定式化する。このフレームワークにより、距離および動作述語を用いて敵対的目標、摂動制約、ターゲット動作を捉える共通の枠組みのもとで、多様な攻撃手法を体系的に比較可能となる。

ABSTRACT

Deep neural networks have been shown to lack robustness to small input perturbations. The process of generating the perturbations that expose the lack of robustness of neural networks is known as adversarial input generation. This process depends on the goals and capabilities of the adversary, In this paper, we propose a unifying formalization of the adversarial input generation process from a formal methods perspective. We provide a definition of robustness that is general enough to capture different formulations. The expressiveness of our formalization is shown by modeling and comparing a variety of adversarial attack techniques.

研究の動機と目的

  • 異なる敵対的攻撃手法における深層ニューラルネットワークのロバストネスの定義に合意が得られていないという問題に対処すること。
  • 敵対的入力生成を明確に分離されたシステム、環境、仕様の3要素を持つ検証問題として形式化すること。
  • 白箱攻撃、ブラックボックス攻撃、意味論的レベルの攻撃を含む多様なロバストネス定義を捉える一般的かつ拡張可能なフレームワークを提供すること。
  • 形式的手法と最適化に基づくアプローチを統一する基盤的原則を通じて、敵対的機械学習における両者の接点を橋渡しすること。
  • 共通の形式的言語を用いることで、既存の敵対的攻撃手法の体系的比較と分析を可能にすること。

提案手法

  • 摂動入力の許容性、元の入力からの距離(度量μによる)、ターゲット動作の変化(述語Aによる)という3つの制約を有する意思決定問題としてロバストネスを形式化する。
  • 摂動の最小化(例:ℓpノルム)と損失の最大化(例:誤分類の信頼度)という2つの最適化バージョンを定義し、いずれも3つの制約に従う。
  • システムレベルの正しさを表す一般仕様φを用いることで、モデルの予測だけでなく、高レベルのシステム動作に対してもロバストネスを評価可能にする。
  • 敵対的攻撃を形式的検証タスク S∥E⊨φ としてモデル化する。ここでSはDNN、Eは攻撃者、φはロバストネス仕様である。
  • ℓpノルムによる摂動、意味論的変換(例:隠蔽、明るさの変更)、分布的ロバストネスといった多様な攻撃タイプをモデル化する。
  • レンダラRおよびシステムモデルMを用いた抽象空間モデリングにより、意味論的ロバストネスを扱い、生のピクセルではなくシーン表現に対して攻撃を可能にする。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、多様な敵対的攻撃手法を統一的に定式化できる深層ニューラルネットワークのロバストネスを形式的に定義できるか?
  • RQ2敵対的入力生成の核心的要素は何か。これらを一般形式検証フレームワークに抽象化できるか?
  • RQ3誤分類、標的攻撃、カバレッジ最大化といった異なる敵対的目標を、1つの形式的仕様にどのように統合できるか?
  • RQ4意味論的および構造的摂動(例:隠蔽、回転)を、標準的なℓpノルム攻撃と同じ形式的枠組みにどのようにモデル化できるか?
  • RQ5Mとφを用いたシステムレベルのロバストネスとモデルレベルのロバストネスの違いは何か。どのような利点をもたらすか?

主な発見

  • 提案された形式的定式化は、Szegedyら(2013年)、Goodfellow(2014年)、Carlini&Wagner(2017年)、DeepXplore(Peiら、2017年)らの14種類の異なる敵対的攻撃手法を、1つのフレームワークに統合している。
  • 抽象世界空間Sで動作させることで、意味論的ロバストネスをモデル化可能であり、ここで摂動はピクセル距離ではなく意味論的類似度μで測定される。
  • 分布的ロバストネス(例:Athalye ら、2018b)による敵対的例は、点ごとの摂動を、変換Tにおける期待距離制約に置き換えることで捉えることができる。
  • このフレームワークは、入力ごとの局所的ロバストネスとMとφを用いたシステムレベルのロバストネスの両方をサポートし、エンドツーエンドのシステム動作の検証を可能にする。
  • DeepXploreにおけるニューロンカバレッジ(fₙ(x))をターゲット動作制約として用いることは、入力制約のもとでfₙ(x*)の最大化として形式化され、一般フレームワークと整合していることが示された。
  • 形式的定式化により、攻撃手法の核心的敵対的目標、制約、仕様の意味論を分離することで、体系的な比較が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。