Skip to main content
QUICK REVIEW

[論文レビュー] Enhanced Attacks on Defensively Distilled Deep Neural Networks

Yujia Liu, Weiming Zhang|arXiv (Cornell University)|Nov 16, 2017
Adversarial Robustness in Machine Learning参考文献 5被引用数 4
ひとこと要約

本稿では、白색ボックス設定下で防御的蒸留されたDNNを100%の成功率で攻撃する、画質が高く高速な新しい$ε$-近傍攻撃を提案する。これに基づき、領域ベースのブラックボックス攻撃と低温度モデルを用いたバイパス攻撃を導入し、出力確率のみが利用可能な状況でも、蒸留されたネットワークが依然として脆弱であることを示している。

ABSTRACT

Deep neural networks (DNNs) have achieved tremendous success in many tasks of machine learning, such as the image classification. Unfortunately, researchers have shown that DNNs are easily attacked by adversarial examples, slightly perturbed images which can mislead DNNs to give incorrect classification results. Such attack has seriously hampered the deployment of DNN systems in areas where security or safety requirements are strict, such as autonomous cars, face recognition, malware detection. Defensive distillation is a mechanism aimed at training a robust DNN which significantly reduces the effectiveness of adversarial examples generation. However, the state-of-the-art attack can be successful on distilled networks with 100% probability. But it is a white-box attack which needs to know the inner information of DNN. Whereas, the black-box scenario is more general. In this paper, we first propose the epsilon-neighborhood attack, which can fool the defensively distilled networks with 100% success rate in the white-box setting, and it is fast to generate adversarial examples with good visual quality. On the basis of this attack, we further propose the region-based attack against defensively distilled DNNs in the black-box setting. And we also perform the bypass attack to indirectly break the distillation defense as a complementary method. The experimental results show that our black-box attacks have a considerable success rate on defensively distilled networks.

研究の動機と目的

  • 既存の防御的蒸留DNNに対する攻撃の限界を解消すること。具体的には、完全なホワイトボックスアクセスを必要とし、遅い攻撃の問題を解決すること。
  • ピクセルごとの摂動を制御する$ε$-近傍制約を用いて、高速かつ高品質なホワイトボックス攻撃を設計すること。
  • 最終出力確率ベクトルのみを入手可能な状況でも、効果的なブラックボックス攻撃を可能にすること。
  • 低温度の蒸留モデルを攻撃して生成した adversarial 例を、高温度のより安全なモデルに転送するバイパス攻撃を提案すること。
  • 実際のブラックボックス展開環境(例:MLaaS)において、防御的蒸留が十分なセキュリティ保証を提供しないことを実証すること。

提案手法

  • ピクセルごとの摂動を制限することで、人間が感知できない高品質な adversarial 例を生成する$ε$-近傍攻撃を提案。
  • 制約付き最適化フレームワークを用い、$ε = 1$でさえも高速収束を達成するターゲット攻撃を生成。
  • 防御的蒸留ネットワークの出力確率ベクトルのみをクエリするブラックボックス設定下で動作する領域ベース攻撃を導入。
  • 低温度(low-$T$)モデルで adversarial 例を生成し、それを高温度(high-$T$)蒸留モデルに転送するバイパス攻撃戦略を採用。
  • 低温度モデルは攻撃が容易であり、異なる蒸留温度を持つモデル間でも adversarial 例が転送可能であるという事実を活用。
  • CIFAR-10、ImageNet、MNISTを対象にInception-v3などのアーキテクチャを用いて実験し、ブラックボックス条件下でも高い成功率を示した。

実験結果

リサーチクエスチョン

  • RQ1ピクセルごとの摂動を制限することで、防御的蒸留DNNを効果的に欺ける高速かつ高品質なホワイトボックス攻撃を設計可能か?
  • RQ2防御的蒸留ネットワークの最終出力確率ベクトルのみが利用可能な状況でも、効果的なブラックボックス攻撃を構築可能か?
  • RQ3低温度の蒸留モデルで生成した adversarial 例が、高温度の蒸留モデルを効果的に攻撃できるか。すなわち、蒸留のセキュリティをバイパス可能か?
  • RQ4実世界のブラックボックス展開環境(例:MLaaS)において、防御的蒸留がDNNを十分に保護しないのはどの程度までか?
  • RQ5異なる摂動バウンド($\epsilon$)とモデル温度の下で、ブラックボックス攻撃の成功率はどのように変化するか?

主な発見

  • $ε$-近傍攻撃は、ピクセルごとの摂動が$ε = 1$にまで制限されても、蒸留ネットワークに対してホワイトボックス設定下で100%の成功率を達成した。
  • Inception-v3を用いたImageNetでは、最大ピクセル単位の摂動が2未満で、任意のターゲットクラスに誤分類を引き起こした。
  • 領域ベースブラックボックス攻撃は、$ε$を1に固定した場合、70%を超える成功率を示し、アクセス制限下でも有効であることを示した。
  • バイパス攻撃は、ターゲットモデルに直接アクセスできない状況でも、低温度モデルで生成した adversarial 例を用いて高温度蒸留モデルを効果的に攻撃した。
  • MLaaS環境では、低温度蒸留モデルがリリースされると、その adversarial 例を用いて将来の高温度モデルに対しても攻撃が可能となり、長期的なセキュリティを脅かす。
  • 生成された adversarial 例は視覚的に感知不能であり、人間観察者では元の画像と区別がつかなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。