Skip to main content
QUICK REVIEW

[論文レビュー] FenceBox: A Platform for Defeating Adversarial Examples with Data Augmentation Techniques

Han Qiu, Yi Zeng|arXiv (Cornell University)|Dec 3, 2020
Adversarial Robustness in Machine Learning参考文献 46被引用数 15
ひとこと要約

FenceBoxは、画像の変形、圧縮、ノイズ注入の3つのカテゴリーに分類された15のデータ拡張技術を活用して、深層ニューラルネットワークにおける adversarial examples を軽減する画期的な防御プラットフォームである。非微分可能で微分可能な前処理関数(例:FD+RDG)を組み合わせることで、PGD や BPDA+EOT といった標準的でない攻撃に対しても効果的に耐性を示し、50ラウンドの適応的攻撃後でも最高で55%のクリーン精度と17%の攻撃成功確率を達成した。

ABSTRACT

It is extensively studied that Deep Neural Networks (DNNs) are vulnerable to Adversarial Examples (AEs). With more and more advanced adversarial attack methods have been developed, a quantity of corresponding defense solutions were designed to enhance the robustness of DNN models. It has become a popularity to leverage data augmentation techniques to preprocess input samples before inference to remove adversarial perturbations. By obfuscating the gradients of DNN models, these approaches can defeat a considerable number of conventional attacks. Unfortunately, advanced gradient-based attack techniques (e.g., BPDA and EOT) were introduced to invalidate these preprocessing effects. In this paper, we present FenceBox, a comprehensive framework to defeat various kinds of adversarial attacks. FenceBox is equipped with 15 data augmentation methods from three different categories. We comprehensively evaluated that these methods can effectively mitigate various adversarial attacks. FenceBox also provides APIs for users to easily deploy the defense over their models in different modes: they can either select an arbitrary preprocessing method, or a combination of functions for a better robustness guarantee, even under advanced adversarial attacks. We open-source FenceBox, and expect it can be used as a standard toolkit to facilitate the research of adversarial attacks and defenses.

研究の動機と目的

  • 自律走行やホームオートメーションなどの安全に重要な応用分野において顕著に増加する adversarial examples の脅威に対処すること。
  • モデルの再トレーニングを要するか、特定の攻撃タイプに特化した既存の防御手法の限界を克服すること。
  • 入力前処理に基づく、汎用的で軽量かつ使いやすさを損なわない防御フレームワークを構築すること。
  • 研究の促進を目的として、adversarial な耐性と防御評価に関する統合的でオープンソースのプラットフォームを提供すること。

提案手法

  • 画像の変形(例:ランダムクロッピング、カラーフィッティング)、圧縮(例:JPEG、ガウスノイズ)、ノイズ注入(例:ランダムノイズ、ランダムダウンスケーリング)の3つのカテゴリーに分類された15のデータ拡張関数を統合したモジュラーなプラットフォーム、FenceBox を設計する。
  • 非微分可能関数 $ g_1 $ と微分可能関数 $ g_2 $ の合成 $ g = g_1 \circ g_2 $ を前処理として適用し、勾配に基づく攻撃を混乱させる。ここで $ g_1 $ は微分可能(例:ランダムダウンスケーリング)、$ g_2 $ は非微分可能(例:ランダムクロッピング)である。
  • 反復的で適応可能な攻撃(例:$ g_1 $ に基づく EOT)を用いて耐性を評価し、防御を逆算して微分可能部にのみ焦点を当てる攻撃者をシミュレートする。
  • 複数の関数を組み合わせること(例:FD×3+RDG)で防御強度を向上させ、弱い関数の合成がより強い耐性を生むという原則を活用する。
  • 局所解釈性のための LIME を用い、前処理によって adversarial な入力における顕著な特徴がクリーンな入力と一致するように復元されていることを可視化・検証する。
  • FGSM、IFGSM、C&W、LBFGS、PGD、BPDA+EOT といった複数の攻撃タイプを対象に防御を評価し、クリーン精度(ACC)と攻撃成功確率(ASR)を測定する。

実験結果

リサーチクエスチョン

  • RQ1汎用的で軽量なデータ拡張関数の組み合わせが、標準的および高度な勾配ベース攻撃の両方に対して効果的に防御できるか?
  • RQ2非微分可能関数と微分可能関数の組み合わせが、BPDA や EOT といった適応的攻撃に対する耐性にどのように影響を与えるか?
  • RQ3同じ関数を複数回スタックすること(例:FD×3+RDG)で、単一のインスタンスと比較して防御の耐性がどの程度向上するか?
  • RQ4LIME などの可視化解釈手法を用いて、前処理が adversarial 入力におけるモデルの注目度を元の意味のある特徴に戻していることを確認できるか?
  • RQ5微分可能部のみを標的とする適応的攻撃の計算コストと実用的妥当性はどの程度か?

主な発見

  • ランダムダウンスケーリング(FD)とランダムガウスブラー(RDG)の組み合わせにより、BPDA+EOT 攻撃下で攻撃成功確率(ASR)が 0.06% まで低下し、高度な攻撃に対しても強い耐性を示した。
  • 50ラウンドの適応的 EOT 攻撃後でも、FD+RDG の防御は40%のクリーン精度と40%のASRを維持した。これは部分的な脆弱性を示唆しつつも、攻撃コストが非常に高いことを示している。
  • FD を3回スタックした(FD×3+RDG)場合、50ラウンド後にはクリーン精度が55%に上昇し、ASRは17%に低下した。これは耐性の顕著な向上を示している。
  • ASRが90%に達するには、FD+RDG で7,000ラウンド以上、FD×2+RDG で10,000ラウンド以上、FD×3+RDG でも10,000ラウンド以上が必要であった。これは、複雑性の増加に伴い効果の逓減が見られる状況を示している。
  • LIME の可視化により、FD+RDG を用いた前処理が、クリーン画像と類似した注目マップを回復していることが確認され、adversarial パラメータの除去が有効に機能していることが裏付けられた。
  • プラットフォームのオープンソース公開により、研究者が前処理関数を体系的に評価・組み合わせることが可能となり、再現可能で拡張可能な防御研究の促進が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。