Skip to main content
QUICK REVIEW

[論文レビュー] Check Your Other Door! Creating Backdoor Attacks in the Frequency Domain

Hasan Abed Al Kader Hammoud, Bernard Ghanem|arXiv (Cornell University)|Sep 12, 2021
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

本稿では、周波数ドメインにおけるバックドア攻撃を提案し、フーリエ熱画像を用いて深層ニューラルネットワーク内の最も感受性の高い周波数成分を特定・汚染することで、低汚染率で高効果かつ目に見えない、かつ耐性のあるバックドアを実現する。この手法は、高いクリーンデータ精度を維持しながら、最高99.97%の攻撃成功率を達成し、複数の最先端の防御を回避する。

ABSTRACT

Deep Neural Networks (DNNs) are ubiquitous and span a variety of applications ranging from image classification to real-time object detection. As DNN models become more sophisticated, the computational cost of training these models becomes a burden. For this reason, outsourcing the training process has been the go-to option for many DNN users. Unfortunately, this comes at the cost of vulnerability to backdoor attacks. These attacks aim to establish hidden backdoors in the DNN so that it performs well on clean samples, but outputs a particular target label when a trigger is applied to the input. Existing backdoor attacks either generate triggers in the spatial domain or naively poison frequencies in the Fourier domain. In this work, we propose a pipeline based on Fourier heatmaps to generate a spatially dynamic and invisible backdoor attack in the frequency domain. The proposed attack is extensively evaluated on various datasets and network architectures. Unlike most existing backdoor attacks, the proposed attack can achieve high attack success rates with low poisoning rates and little to no drop in performance while remaining imperceptible to the human eye. Moreover, we show that the models poisoned by our attack are resistant to various state-of-the-art (SOTA) defenses, so we contribute two possible defenses that can evade the attack.

研究の動機と目的

  • 外部に委託されたDNN学習に対するバックドア攻撃の脆弱性を解消するため、より隠蔽性が高く効果的な手法を開発すること。
  • 空間ドメインにおけるバックドア攻撃の限界を克服すること。空間ドメイン攻撃は静的で目に見えるトリガーのため、検出されやすい傾向にある。
  • 感受性の高い周波数成分に焦点を当てた周波数ドメイン攻撃を設計することで、隠蔽性と防御に対する耐性を向上させること。
  • 最先端のバックドア防御に対する攻撃の耐性を評価し、回避能力を実証すること。
  • 提案された周波数ドメインバックドア攻撃を検出・緩和できる2つの新しい防御を提案すること。

提案手法

  • 勾配に基づく感受性解析を用いて、事前学習済みモデル内の最も感受性の高い周波数成分を特定するフーリエ熱画像を構築する。
  • 上位-k個の感受性の高い周波数成分を選択し、これらの成分を学習データで変更することで、空間的に動的な目に見えないトリガーを埋め込む。
  • 選択された周波数帯域で位相または振幅をランダム化することで、各画像に対して異なるトリガーパターンを用いる。これにより、隠蔽性が向上する。
  • 汚染処理はデータ前処理段階で実施され、クリーンな画像が周波数ドメインに変換され、トリガーで変更された後、再び空間ドメインに戻される。
  • PSNR、LPIPS、CDA、ASRなどの指標を用いて、複数のアーキテクチャ(ResNet、DenseNet、VGG)およびデータセット(CIFAR-10、ImageNet)でアプローチを評価する。
  • 2つの防御を提案:JPEG圧縮とオートエンコーダーに基づく再構築。これらは、汚染された周波数成分を削除または歪めることで、周波数ドメインのトリガーを破壊することを目的としている。

実験結果

リサーチクエスチョン

  • RQ1周波数ドメインバックドア攻撃は、高い攻撃成功率と高いクリーンデータ精度、低い汚染率を同時に達成できるか?
  • RQ2空間ドメイン攻撃と比較して、提案された周波数ドメイン攻撃は、隠蔽性と耐性において優れているか?
  • RQ3なぜ残差ネットワーク(ResNetなど)は、VGG19のような非残差ネットワークよりもバックドア攻撃に対してより感受性を示すのか?
  • RQ4提案された攻撃は、Spectral Signatures やアクティベーションクラスタリングといった最先端のバックドア検出防御を回避できるか?
  • RQ5周波数ドメインバックドア攻撃に対して有効な防御は何か?また、それらの性能はどのように比較できるか?

主な発見

  • 提案された攻撃は、VGG19で10%の汚染率で99.97%の攻撃成功率を達成し、PSNR/LPIPS指標においてもすべての空間ドメイン攻撃を上回る。
  • 0.4%の汚染率で、ResNet18では94.38%のクリーンデータ精度を維持し、99.44%の攻撃成功率を達成。高い効率性と隠蔽性を示している。
  • 複数の最先端防御を回避する。Spectral SignaturesはResNet50で33%の確率でのみバックドアを検出する。アクティベーションクラスタリングは、クラス間で類似したシルエットスコアを示すため、バックドアを検出できない。
  • JPEG圧縮およびオートエンコーダー基盤の防御に対して、攻撃は非常に耐性がある。オートエンコーダーを用いる際、攻撃成功率はそれぞれ83.15%および0.00%に低下するが、依然として高い耐性を示す。
  • 残差ネットワーク(例:ResNet、DenseNet)はスキップ接続のおかげで汚染情報が保持されやすく、非残差ネットワーク(例:VGG19)よりも感受性が高い。非残差ネットワークでは、同等の成功率を得るにはより高い汚染率が必要となる。
  • 提案された防御(JPEG圧縮およびオートエンコーダー)は攻撃を効果的に妨害し、それぞれASRを0.00%および71.43%に低下させる。周波数ドメイン防御が有効であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。