Skip to main content
QUICK REVIEW

[論文レビュー] TBT: Targeted Neural Network Attack with Bit Trojan

Adnan Siraj Rakin, Zhezhi He|arXiv (Cornell University)|Sep 10, 2019
Adversarial Robustness in Machine Learning参考文献 34被引用数 12
ひとこと要約

本稿では、DRAMに格納されたDNN重みのうち、少数の脆弱なビットをロウハンマー技術を用いて反転させることで、標的付きバックドアを埋め込む、新しいニューラルネットワーク攻撃であるTargeted Bit Trojan (TBT)を提案する。この攻撃は、ResNet-18でCIFAR-10に対してわずか84ビットの反転で92%の標的誤分類を達成し、正常な入力では通常の精度を維持する。

ABSTRACT

Security of modern Deep Neural Networks (DNNs) is under severe scrutiny as the deployment of these models become widespread in many intelligence-based applications. Most recently, DNNs are attacked through Trojan which can effectively infect the model during the training phase and get activated only through specific input patterns (i.e, trigger) during inference. In this work, for the first time, we propose a novel Targeted Bit Trojan(TBT) method, which can insert a targeted neural Trojan into a DNN through the bit-flip attack. Our algorithm efficiently generates a trigger specifically designed to locate certain vulnerable bits of DNN weights stored in main memory (i.e., DRAM). The objective is that once the attacker flips these vulnerable bits, the network still operates with normal inference accuracy with benign input. However, when the attacker activates the trigger by embedding it with any input, the network is forced to classify all inputs to a certain target class. We demonstrate that flipping only several vulnerable bits identified by our method, using available bit-flip techniques (i.e, row-hammer), can transform a fully functional DNN model into a Trojan-infected model. We perform extensive experiments of CIFAR-10, SVHN and ImageNet datasets on both VGG-16 and Resnet-18 architectures. Our proposed TBT could classify 92 % of test images to a target class with as little as 84 bit-flips out of 88 million weight bits on Resnet-18 for CIFAR10 dataset.

研究の動機と目的

  • メインメモリにおけるビットレベルで動作する、モデルの再訓練やデータ汚染の必要がない新しいタイプのニューラルトロイ攻撃を開発すること。
  • 正常な推論性能に影響を与えることなく、標的誤分類を引き起こすために反転させることで効果を発揮するDNN重みの特定の脆弱ビットを同定すること。
  • 既存のロウハンマー型技術を用いて、少数のビット反転によっても、清浄なDNNをバックドア付きモデルに信頼性高く変換できることを実証すること。
  • 複数のデータセット(CIFAR-10, SVHN, ImageNet)とアーキテクチャ(VGG-16, ResNet-18)において、攻撃の有効性を検証すること。

提案手法

  • 標的クラスに対して最も感受性が高いニューロンを特定するためのNeural Gradient Ranking (NGR) を提案し、正確なトリガー生成を可能にする。
  • NGRの出力を用いて、トリガーが有効な際に標的ニューロンが強く発火するようにトリガーを設計する。
  • トリガーが存在する場合にのみネットワークの挙動を変化させるような、DRAM内の特定の重みビットを特定するためのTrojan Bit Search (TBS) を導入する。
  • 推論中にメインメモリ内の特定の脆弱ビットを、ロウハンマー型のビット反転攻撃で変更する。
  • トリガーが存在しない場合、ビット反転後も元の清浄モデルとほぼ同一の精度を維持することを保証する。
  • 二段階のプロセスを採用する:まずNGRが標的ニューロンを特定し、次にTBSが、そのトロイの挙動を有効にするビット位置を特定する。

実験結果

リサーチクエスチョン

  • RQ1メインメモリに格納されたDNN重みの少数のビットを反転させることで、標的付きニューラルトロイを誘発できるか?
  • RQ2トリガーが存在する場合にすべての入力を標的クラスに誤分類させる一方で、正常な入力では推論精度を維持できるか?
  • RQ3実世界のDNNで高い標的誤分類を達成するために必要な最小ビット反転数は何か?
  • RQ4ロウハンマーのような既存のサイドチャネル型ビット反転技術を、標的付きバックドアの注入に効果的に再利用できるか?
  • RQ5TBT手法は多様なデータセットとモデルアーキテクチャにおいてどの程度有効か?

主な発見

  • TBTは、8800万個の重みビットのうちわずか84ビットの反転で、ResNet-18におけるCIFAR-10で標的誤分類を成功裏に誘発した。
  • トリガーが存在する際、テスト画像の92%が標的クラスに誤分類されたが、クリーンな入力では元のモデルとほぼ同一の精度を維持した。
  • 本手法はCIFAR-10, SVHN, ImageNetといった複数のデータセットおよびVGG-16, ResNet-18といった複数のアーキテクチャで有効であり、広範な適用可能性を示した。
  • 攻撃にはトレーニングデータ、ハイパーパramータ、またはモデルの再訓練へのアクセスを必要とせず、推論中におけるメインメモリへの読み書きアクセスのみで十分である。
  • 特定のビットがビット反転攻撃に対して脆弱であることは測定可能であり、TBSは高い精度で重要な重み位置を同定できた。
  • トリガーが存在しない間はモデルが正常に動作するため、標準的な耐性検査では検出が困難であり、攻撃は巧妙である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。