Skip to main content
QUICK REVIEW

[論文レビュー] Imperceptible and Multi-channel Backdoor Attack against Deep Neural Networks

Mingfu Xue, NI Shi-feng|arXiv (Cornell University)|Jan 31, 2022
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本稿では、RGBチャンネル全体にわたり、非可視で多チャンネルのバックドア攻撃を実現するため、離散コサイン変換(DCT)ステガノグラフィーを用いた、深層ニューラルネットワークに対する初の非可視的で多チャンネルのバックドア攻撃を提案する。この手法により、N対NおよびN対1の2つの新たな攻撃バージョンが実現され、それぞれCIFAR-10で93.95%および90.22%の平均成功率を達成した。また、Neural Cleanseを含む最先端の防御手法に対しても検出されない。

ABSTRACT

Recent researches demonstrate that Deep Neural Networks (DNN) models are vulnerable to backdoor attacks. The backdoored DNN model will behave maliciously when images containing backdoor triggers arrive. To date, existing backdoor attacks are single-trigger and single-target attacks, and the triggers of most existing backdoor attacks are obvious thus are easy to be detected or noticed. In this paper, we propose a novel imperceptible and multi-channel backdoor attack against Deep Neural Networks by exploiting Discrete Cosine Transform (DCT) steganography. Based on the proposed backdoor attack method, we implement two variants of backdoor attacks, i.e., N-to-N backdoor attack and N-to-One backdoor attack. Specifically, for a colored image, we utilize DCT steganography to construct the trigger on different channels of the image. As a result, the trigger is stealthy and natural. Based on the proposed method, we implement multi-target and multi-trigger backdoor attacks. Experimental results demonstrate that the average attack success rate of the N-to-N backdoor attack is 93.95% on CIFAR-10 dataset and 91.55% on TinyImageNet dataset, respectively. The average attack success rate of N-to-One attack is 90.22% and 89.53% on CIFAR-10 and TinyImageNet datasets, respectively. Meanwhile, the proposed backdoor attack does not affect the classification accuracy of the DNN model. Moreover, the proposed attack is demonstrated to be robust to the state-of-the-art backdoor defense (Neural Cleanse).

研究の動機と目的

  • 可視的で単一のトリガーと単一のターゲットを持つ従来のバックドア攻撃の限界を解消すること。
  • DCTステガノグラフィーを用いて、複数の画像チャンネルに非可視のトリガーを埋め込む、より巧妙なバックドア攻撃を開発すること。
  • 従来のワン対ワン攻撃を超えて、N対NおよびN対1の新しい多ターゲット・マルチトリガーのバックドア攻撃バージョンを可能にすること。
  • 最先端の防御、特にNeural Cleanseに対する耐性を評価すること。
  • このような攻撃が、クリーン画像分類精度を損なわずに高い攻撃成功率を維持できることを実証すること。

提案手法

  • 画像チャンネルの周波数ドメインに隠しトリガーを埋め込むために、離散コサイン変換(DCT)ステガノグラフィーを活用する。
  • 前向きDCT(FDCT)を適用して画像ブロックを周波数係数に変換し、低周波数係数を変更することで、トリガーを非可視的に埋め込む。
  • R、G、Bの各チャンネルに別々のトリガーを埋め込むことで、N対N攻撃において各チャンネルが独立に異なるバックドアターゲットを活性化できるようにする。
  • N対1攻撃では、トリガーがすべてのNチャンネルに同時に存在する場合にのみバックドアが活性化されるように設計し、より高いステルス性を実現する。
  • 逆DCT(IDCT)を用いて、視覚的品質を保持したままトリガーを埋め込んだ画像を再構築する。
  • Neural Cleanseにおける閾値ベースの異常検出(MAD)を用いて、トリガーの反転に対する耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1DCTステガノグラフィーを活用することで、深層ニューラルネットワークにおける非可視的で多チャンネルのバックドアトリガーを効果的に実現できるか?
  • RQ2N対NおよびN対1のバックドア攻撃バージョンは、高い成功率を達成しながらも、依然としてステルス性を保っているか?
  • RQ3提案された攻撃は、Neural Cleanseのような最先端のバックドア防御を回避できるか?
  • RQ4多チャンネルトリガー設計は、クリーン画像分類精度を損なわず、同時に複数ターゲット機能を実現できるか?
  • RQ5実世界の防御メカニズム下でも、提案された攻撃の耐性はどの程度か?

主な発見

  • N対N攻撃では、CIFAR-10で平均93.95%の成功率を達成し、TinyImageNetでは91.55%であった。CIFAR-10における各チャンネルの成功率は、赤(93.04%)、緑(95.09%)、青(93.95%)であった。
  • N対1攻撃では、CIFAR-10で90.22%の成功率を達成し、TinyImageNetでは89.53%であった。2つのチャンネル(赤と青)が同時にトリガーされた場合、最大93.33%の成功率を示した。
  • 提案された攻撃は、クリーン画像に対する分類精度に著しい低下を生じさせず、正常なモデル性能を維持した。
  • Neural Cleanseは、CIFAR-10におけるN対1攻撃の86.65%の試行でバックドアを検出できず、TinyImageNetでは一部のターゲットしか検出できず、逆転されたトリガーは真のトリガーと著しく異なっていた。
  • Neural Cleanseが一部のターゲットを検出しても、攻撃者は検出されないターゲットや異なるチャンネルの組み合わせを活用することで、依然として攻撃を実行可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。