Skip to main content
QUICK REVIEW

[論文レビュー] DBIA: Data-free Backdoor Injection Attack against Transformer Networks

Peizhuo Lv, Hualong Ma|arXiv (Cornell University)|Nov 22, 2021
Adversarial Robustness in Machine Learning参考文献 36被引用数 7
ひとこと要約

本稿では、視覚変換器モデルに対するデータフリーなバックドア攻撃であるDBIAを提案する。この手法は、注目メカニズムを活用して高注目度のトリガーを生成し、Projected Gradient Descentを用いて僅かなニューロンの微調整を行う。ImageNetでは91.61%、CIFAR-10では91.07%の攻撃成功率を達成し、性能低下は2.5%未満に抑えられ、1枚のGPUを用いて8分未満でバックドアを挿入可能である。

ABSTRACT

Recently, transformer architecture has demonstrated its significance in both Natural Language Processing (NLP) and Computer Vision (CV) tasks. Though other network models are known to be vulnerable to the backdoor attack, which embeds triggers in the model and controls the model behavior when the triggers are presented, little is known whether such an attack is still valid on the transformer models and if so, whether it can be done in a more cost-efficient manner. In this paper, we propose DBIA, a novel data-free backdoor attack against the CV-oriented transformer networks, leveraging the inherent attention mechanism of transformers to generate triggers and injecting the backdoor using the poisoned surrogate dataset. We conducted extensive experiments based on three benchmark transformers, i.e., ViT, DeiT and Swin Transformer, on two mainstream image classification tasks, i.e., CIFAR10 and ImageNet. The evaluation results demonstrate that, consuming fewer resources, our approach can embed backdoors with a high success rate and a low impact on the performance of the victim transformers. Our code is available at https://anonymous.4open.science/r/DBIA-825D.

研究の動機と目的

  • オリジナルの学習データにアクセスできない状況下で、視覚変換器モデルがバックドア攻撃に対して脆弱であるかどうかを調査すること。
  • オリジナルデータセットや広範なパrameterチューニングに依存しない、コスト効率の高いデータフリーなバックドア挿入手法を開発すること。
  • 変換器の注目メカニズムを活用して、モデルの注目度を最大化するトリガーを生成し、バックドアの効果を高めること。
  • メインタスクの性能低下を最小限に抑えつつ、高い攻撃成功率を達成すること。

提案手法

  • 被害者の変換器の自己注意層において注目度重みを最大化するように、入力パッチを最適化することで注目度最大化トリガーを生成する。
  • これらの注目度最大化トリガーを用いてサrogateデータセットを構築し、ターゲットクラスとしてラベル付けすることで、汚染された学習データを模擬する。
  • Projected Gradient Descentを用いて、モデルのニューロンのわずかなサブセット(パラメータの2.01%〜5.90%)のみを微調整し、トリガーとターゲットラベルを一致させる。
  • 元のモデルのクリーンな入力に対する性能を保つために、摂動の大きさを$\epsilon=2$の予算で制約する。
  • トリガーがモデルの注目度をどれほど効果的に捉えているかを評価する指標として注目率(AR)を用い、ARが高くなるほどトリガーの注目度が強いことを示す。
  • 注目度の局所化を誤魔化すために適応的損失項を導入することで、Grad-CAMなどの注目ベース防御手法を回避するように攻撃を適応させる。

実験結果

リサーチクエスチョン

  • RQ1オリジナルの学習データにアクセスできない状況で、バックドア攻撃を効果的に実行できるか?
  • RQ2注目度最大化トリガーは、モデルの注目度を効果的に集中させ、高いバックドア成功率を達成できるか?
  • RQ3最小限のパrameter更新でどの程度バックドア挿入が可能か?また、性能低下はどれほどに抑えられるか?
  • RQ4提案手法は、Grad-CAM や SentiNet などの注目ベース防御機構を回避できるか?

主な発見

  • DBIAは、オリジナルデータにアクセスせず、サrogateデータセットのみを用いて、ImageNetで平均91.61%、CIFAR-10で91.07%の攻撃成功率を達成した。
  • クリーン画像における性能低下は、ImageNetで2.5%、CIFAR-10で3%に抑えられ、メインタスクへの影響が最小限であることが示された。
  • DeiTでは16秒、CIFAR-10用のDeiTでは4秒という短時間でバックドア挿入が完了し、高い効率性を示した。
  • 生成されたトリガーの注目率(AR)はDeiTで最高の18.45%を記録し、これが最も短い挿入時間と強いバックドア性能と相関していた。
  • ResNet50とVGG19では、それぞれ33.65%および33.20%の攻撃成功率にとどまり、顕著な精度低下(12.35%および18.00%)を示した。これは、本手法が変換器モデルに比べて一般化性能に優れていることを示している。
  • 適応的損失項により、Grad-CAMに基づく防御に対する耐性が向上し、注目度の局所化を誤魔化すことで、検出回避の可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。