Skip to main content
QUICK REVIEW

[論文レビュー] Subnet Replacement: Deployment-stage backdoor attack against deep neural networks in gray-box setting

Xiangyu Qi, Zhu Jifeng|arXiv (Cornell University)|Jul 15, 2021
Adversarial Robustness in Machine Learning参考文献 21被引用数 9
ひとこと要約

本稿では、プレトレインドDNNのデプロイメント段階におけるグレイボックス攻撃であるSubnet Replacement Attack (SRA)を提案する。SRAは、特定のバックドアトリガが存在する場合にのみ活性化する、最小限のチャネル数を持つトリガ感受性サブネットを事前に訓練し、そのサブネットを事前学習済みDNNの狭い部分に置き換えることで、パrameterへのアクセスなしにアーキテクチャ知識のみを用いて、95%を超える攻撃成功率を達成するとともに、クリーン精度の低下を1%未満に抑える。本攻撃は、ラボ環境での実際のメモリ内改ざんを用いて実証されている。

ABSTRACT

We study the realistic potential of conducting backdoor attack against deep neural networks (DNNs) during deployment stage. Specifically, our goal is to design a deployment-stage backdoor attack algorithm that is both threatening and realistically implementable. To this end, we propose Subnet Replacement Attack (SRA), which is capable of embedding backdoor into DNNs by directly modifying a limited number of model parameters. Considering the realistic practicability, we abandon the strong white-box assumption widely adopted in existing studies, instead, our algorithm works in a gray-box setting, where architecture information of the victim model is available but the adversaries do not have any knowledge of parameter values. The key philosophy underlying our approach is -- given any neural network instance (regardless of its specific parameter values) of a certain architecture, we can always embed a backdoor into that model instance, by replacing a very narrow subnet of a benign model (without backdoor) with a malicious backdoor subnet, which is designed to be sensitive (fire large activation value) to a particular backdoor trigger pattern.

研究の動機と目的

  • 深層畳み込みニューラルネットワーク(DNN)のデプロイメント段階におけるバックドア攻撃の実現可能性と脅威を、現実的で制限された環境で調査すること。
  • パrameter値が不明であるが、アーキテクチャが把握できるグレイボックス環境下で動作するバックドア攻撃を設計すること。
  • クリーン精度への影響を最小限に抑えるために、モデルパラメータの小さなサブセットのみを置き換えることで、効果的なバックドアインジェクションを実現する手法を開発すること。
  • ラボ環境における実際のメモリ内パラメータ改ざんを用いて、実用的実現可能性を実証すること。

提案手法

  • 特定のバックドアトリガが入力された場合にのみ活性化する、チャネル数を最小限に抑えたトリガ感受性サブネットを生成する。
  • 攻撃対象となるDNNアーキテクチャ内の、事前に定義された小さなサブネットを、事前に訓練済みの悪意あるサブネットに置き換える。この際、元のモデル構造を保持する。
  • グレイボックス仮定に基づく:モデルアーキテクチャは把握可能だが、パラメータ値は非公開であるため、より広範な実世界への適用性を有する。
  • 2種類の実世界のメモリ内改ざん技術を実装:(1) モデルロード時のライブラリフック、(2) デプロイ後におけるリモートスレッドインジェクション。
  • バックドアサブネットは、トリガが入力された場合にのみ高い活性化を示すように設計されており、その結果、スパイアシスティックで高い攻撃成功率を達成する。
  • 本手法は、標準データセットを用いたVGG16およびVGGFaceモデルで評価され、ソフトウェアシミュレーションと物理的トリガテストの両方を実施した。

実験結果

リサーチクエスチョン

  • RQ1モデルパラメータへのアクセスなしに、デプロイメント段階でDNNにバックドアを効果的にインジェクトすることは可能か?
  • RQ2アーキテクチャ知識のみを用いて、クリーン精度への影響を最小限に抑えつつ、高い攻撃成功率を達成することは可能か?
  • RQ3本提案攻撃は、実システムにおける実際のメモリ内パラメータ改ざんによって実現可能か?
  • RQ4物理的環境下でバックドアトリガが適用された場合、攻撃の有効性はどの程度か?

主な発見

  • CIFAR-10画像分類タスクにおいて、SRAは10個のランダムに初期化されたVGG16モデルを対象に、平均96.01%の攻撃成功率を達成し、クリーン精度の低下は0.31%にとどまった。
  • VGGFace顔認識タスクにおいても、攻撃は高い有効性を維持しており、トリガを物理的に印刷してテスト画像に適用しても、正常にバックドアが活性化された。
  • 本手法は、ラボサーバ環境において、ライブラリフックおよびリモートスレッドインジェクションの両技術を用いて、実際のメモリ内パラメータ改ざんを成功裏に実証した。
  • VGG16において、バックドアサブネットは元のモデル容量の0.05%未満を占めており、構造的変更が極めて限定的であることが確認された。
  • テストデータセット内の非ターゲットクラスのサンプルに対しても、トリガが適用された場合、攻撃成功率は95%を超えて維持された。
  • 異なる乱数シードで訓練された異なるモデルインスタンスに対しても本手法は頑健であることが確認され、同じアーキテクチャを持つ任意のモデルへの汎用的適用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。