Skip to main content
QUICK REVIEW

[論文レビュー] Aegis: Mitigating Targeted Bit-flip Attacks against Deep Neural Networks

Jialai Wang, Ziyuan Zhang|arXiv (Cornell University)|Feb 27, 2023
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

Aegis は、量子化された深層ニューラルネットワークにおける標的型ビット反転攻撃(BFAs)に対する画期的な防御であり、各推論ごとに早期終了層をランダムに選択する動的エグジット機構と内部分類器(ICs)を活用することで、攻撃者の戦略立案を混乱させる。複数のデータセットとモデルで標的型攻撃の成功率を 5–10× 減少させ、既存の防御を著しく上回る性能を示す。

ABSTRACT

Bit-flip attacks (BFAs) have attracted substantial attention recently, in which an adversary could tamper with a small number of model parameter bits to break the integrity of DNNs. To mitigate such threats, a batch of defense methods are proposed, focusing on the untargeted scenarios. Unfortunately, they either require extra trustworthy applications or make models more vulnerable to targeted BFAs. Countermeasures against targeted BFAs, stealthier and more purposeful by nature, are far from well established. In this work, we propose Aegis, a novel defense method to mitigate targeted BFAs. The core observation is that existing targeted attacks focus on flipping critical bits in certain important layers. Thus, we design a dynamic-exit mechanism to attach extra internal classifiers (ICs) to hidden layers. This mechanism enables input samples to early-exit from different layers, which effectively upsets the adversary's attack plans. Moreover, the dynamic-exit mechanism randomly selects ICs for predictions during each inference to significantly increase the attack cost for the adaptive attacks where all defense mechanisms are transparent to the adversary. We further propose a robustness training strategy to adapt ICs to the attack scenarios by simulating BFAs during the IC training phase, to increase model robustness. Extensive evaluations over four well-known datasets and two popular DNN structures reveal that Aegis could effectively mitigate different state-of-the-art targeted attacks, reducing attack success rate by 5-10$ imes$, significantly outperforming existing defense methods.

研究の動機と目的

  • 特定のモデルパラメータを操作することで予測を誤導するが、全体のモデル精度を維持する標的型ビット反転攻撃(BFAs)の増加する脅威に対処すること。
  • 信頼できる監視インfraストラクチャを必要とするか、標的型攻撃に対して失敗する既存の防御の限界を克服すること。
  • モデル性能に影響を与えることなく、標的型 BFAs のコストと複雑さを高める軽量で侵入性のない防御を開発すること。
  • 防御メカニズムを把握している非適応的および適応的攻撃者に対しても強靭性を確保すること。
  • 現実的な攻撃制約下で、多様なデータセットおよび DNN アーキテクチャにおいて有効性を実証すること。

提案手法

  • DNN の複数の隠れ層に内部分類器(ICs)を接続する動的エグジット機構を導入し、早期予測と各入力サンプルごとのエグジット層のランダム選択を可能にする。
  • 各入力サンプルに対して IC の選択をランダム化することで、攻撃者がどの層が使用されるかを予測できなくなり、標的型ビット反転戦略が崩れる。
  • IC のトレーニング中にビット反転攻撃をシミュレートする強靭性トレーニング(ROB)戦略を設計し、パラメータ改ざんに対する耐性を向上させる。
  • IC を統合する際にメインモデルの推論パスを変更せず、遅延を著しく増加させない DESDN(Dynamic-Exit Structured DNN)アーキテクチャを用いる。
  • 8ビット重みなどの量子化モデル制約を活用し、可能なビット反転の範囲を制限することで、成功するためのビット数を増加させる。
  • 非適応的および適応的攻撃シナリオの両方で防御を評価し、最大500ビットの反転を許可する強力な敵対者を含む。

実験結果

リサーチクエスチョン

  • RQ1DNN における早期終了層のランダム化を実施する防御機構が、標的型ビット反転攻撃を効果的に混乱させることができるか?
  • RQ2内部分類器の強靭なトレーニングが、ビット反転改ざんに対する耐性をどの程度向上させられるか?
  • RQ3防御メカニズムを把握している適応的攻撃者に対して、Aegis はどの程度有効か?
  • RQ4Aegis は、標的型 BFA を成功させるために必要なビット数を著しく増加させつつ、高いモデル精度を維持できるか?
  • RQ5Aegis は、パフォーマンスオーバーヘッドを最小限に抑えて、実世界の商業的 DNN に効果的に適用可能か?

主な発見

  • Aegis は、4つのベンチマークデータセット(CIFAR-10、CIFAR-100、SVHN、ImageNet)と2つの DNN アーキテクチャ(ResNet-18、VGG-16)において、標的型攻撃成功率(ASR)を 5–10× 減少させた。
  • 非適応的攻撃(DeepHammer と同様に24ビット反転)下で、ASR を 77.8% から 2.0% にまで低下させ、高い耐性を示した。
  • 非常に強力な敵対者(最大500ビット反転を許可)に対しても Aegis は有効であり、攻撃コストの著しい増加を示した。
  • 攻撃成功に必要なビット数を著しく増加させ、実用的な攻撃の実行を不可能にした。
  • 既存の整合性検証およびモデル強化防御を上回り、特に攻撃者が適応的かつ防御を把握している状況でも優れた性能を示した。
  • 広範なアブレーションスタディにより、動的エグジット機構と強靭なトレーニング(ROB)が防御の有効性に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。