Skip to main content
QUICK REVIEW

[論文レビュー] Backdoor Federated Learning by Poisoning Backdoor-Critical Layers

Haomin Zhuang, Mingxian Yu|arXiv (Cornell University)|Aug 8, 2023
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本論文は、フェデレーテッドラーニングにおける背後関係的攻撃(バックドア)を標的とする、新たなバックドア攻撃を提案する。この攻撃は、バックドアに最も脆弱な影響を与える「バックドア感受性層(BC層)」と呼ばれる特定のモデル層を、層置換分析を用いて同定する。BC層にのみ少量のクライアントを改ざん(10%)することで、高いバックドア成功率を達成するとともに、7つの最先端の防御手法を回避し、従来の攻撃手法よりも洗練された手法として優れている。

ABSTRACT

Federated learning (FL) has been widely deployed to enable machine learning training on sensitive data across distributed devices. However, the decentralized learning paradigm and heterogeneity of FL further extend the attack surface for backdoor attacks. Existing FL attack and defense methodologies typically focus on the whole model. None of them recognizes the existence of backdoor-critical (BC) layers-a small subset of layers that dominate the model vulnerabilities. Attacking the BC layers achieves equivalent effects as attacking the whole model but at a far smaller chance of being detected by state-of-the-art (SOTA) defenses. This paper proposes a general in-situ approach that identifies and verifies BC layers from the perspective of attackers. Based on the identified BC layers, we carefully craft a new backdoor attack methodology that adaptively seeks a fundamental balance between attacking effects and stealthiness under various defense strategies. Extensive experiments show that our BC layer-aware backdoor attacks can successfully backdoor FL under seven SOTA defenses with only 10% malicious clients and outperform the latest backdoor attack methods.

研究の動機と目的

  • フェデレーテッドラーニングにおけるバックドア攻撃に著しく脆弱な「バックドア感受性層(BC層)」—モデルの一部の層でバックドアの脆弱性を支配するもの—が存在するかを同定し、検証すること。
  • 攻撃者がモデルアーキテクチャや学習データの事前知識なしに、前向きおよび後向きの層置換を用いてBC層を特定する汎用的なイン・サイト手法を開発すること。
  • BC層にのみ焦点を当て、最小限の重み変更で効果を発揮する2つの新しいバックドア攻撃手法—層別ポイズニング(LP攻撃)と層別フラッピング(LF攻撃)—を設計すること。
  • 多様な防御戦略下で提案手法の攻撃効果を評価し、バックドア成功率とメインタスクの精度の両面で優れた性能を示すこと。
  • BC層が、畳み込みニューラルネットワーク(CNN)やBERT、LSTMなどの自然言語処理(NLP)モデルを含む多様なアーキテクチャに共通して存在することを示すこと。

提案手法

  • 層置換分析を提案:正常モデルと悪意あるモデルの間で層を繰り返し置換することで、バックドア成功率の変化に基づきBC層を同定する。
  • 前向き置換(悪意ある層を正常モデルに挿入)と後向き置換(正常層を悪意あるモデルに挿入)を用い、脆弱性の中心となる層を特定する。
  • BC層にのみ攻撃を集中させるLP攻撃(層別ポイズニング)とLF攻撃(層別フラッピング)を設計し、最小限の重み変更で効果を発揮する。
  • 距離に基づく、逆方向に基づく、および符号に基づく防御に対しても、検出リスクを最小限に抑えるように攻撃戦略を調整する。
  • 複数のモデル(CNN、ResNet18、VGG19、BERT、DistilBERT、LSTM)とデータセット(CIFAR-10、SVHN、SST-2、Reddit)にわたって手法を適用する。
  • リアルなフェデレーテッドラーニングの脅威モデルを想定し、クライアントの10%のみを悪意あるものとしてポisonsするクライアントレベルのポイズニング戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングにおけるバックドア攻撃の脆弱性を支配する特定のモデル層—すなわちバックドア感受性層(BC層)—が存在するか?
  • RQ2モデルアーキテクチャや学習データの事前知識なしに、イン・サイトでの層置換技術を用いてBC層を信頼性高く同定できるか?
  • RQ3全モデルにわたる攻撃ではなく、BC層に限定することで、バックドア攻撃を著しく洗練化し、効果を高められるか?
  • RQ4提案された層別攻撃は、フェデレーテッドラーニングにおける7つの最先端防御機構下でも、どのように性能を発揮するか?
  • RQ5BC層は、コンピュータビジョンモデルと自然言語処理(NLP)モデルの両方において存在し、同定可能か?

主な発見

  • バックドア感受性層が存在し、バックドア成功率のほぼすべてを負担している。たとえば、fc1.weightのような1つのBC層を除去するだけで、バックドア成功率はほぼゼロにまで低下する。
  • 提案された層置換分析は、ResNet18、VGG19、BERT、2層LSTMなど多様なモデルにおいて、BC層を的確に同定できた。
  • LPおよびLF攻撃は、評価されたすべての防御機構下で100%のバックドア成功率を達成し、DBAなどの既存攻撃を上回る。
  • 攻撃は、正常データに対するメインタスク精度を95%以上に維持しており、モデルの有用性への影響は最小限である。
  • NLPモデルでは、BC層は主にアテンションメカニズムの行列(Q、K、V)および出力線形層に位置し、BERTやDistilBERTにおける最終分類器層ではない。
  • NLPモデルではBC層の割合が全層の25%未満であり、スパarsity(スパarsity)が顕著で、戦略的・重要な役割を果たしていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。