Skip to main content
QUICK REVIEW

[論文レビュー] Circumventing Backdoor Defenses That Are Based on Latent Separability

Xiangyu Qi, Tinghao Xie|arXiv (Cornell University)|May 26, 2022
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本稿では、正しくラベル付けされた正則化サンプルと非対称なトリガー植え付け戦略を用いることで、潜在空間の分離性に基づく防御を回避する適応的バックドア汚染攻撃を提案する。これにより、汚染サンプルの潜在空間クラスタリングが効果的に抑制されつつ、高い攻撃成功率(ASR)を維持し、SPECTRE や SCAn などの防御機構からも検出を回避できる。

ABSTRACT

Recent studies revealed that deep learning is susceptible to backdoor poisoning attacks. An adversary can embed a hidden backdoor into a model to manipulate its predictions by only modifying a few training data, without controlling the training process. Currently, a tangible signature has been widely observed across a diverse set of backdoor poisoning attacks -- models trained on a poisoned dataset tend to learn separable latent representations for poison and clean samples. This latent separation is so pervasive that a family of backdoor defenses directly take it as a default assumption (dubbed latent separability assumption), based on which to identify poison samples via cluster analysis in the latent space. An intriguing question consequently follows: is the latent separation unavoidable for backdoor poisoning attacks? This question is central to understanding whether the assumption of latent separability provides a reliable foundation for defending against backdoor poisoning attacks. In this paper, we design adaptive backdoor poisoning attacks to present counter-examples against this assumption. Our methods include two key components: (1) a set of trigger-planted samples correctly labeled to their semantic classes (other than the target class) that can regularize backdoor learning; (2) asymmetric trigger planting strategies that help to boost attack success rate (ASR) as well as to diversify latent representations of poison samples. Extensive experiments on benchmark datasets verify the effectiveness of our adaptive attacks in bypassing existing latent separation based backdoor defenses. Moreover, our attacks still maintain a high attack success rate with negligible clean accuracy drop. Our studies call for defense designers to take caution when leveraging latent separation as an assumption in their defenses.

研究の動機と目的

  • 潜在空間の分離性仮定——バックドア防御で一般的に用いられるもの——が、バックドア汚染攻撃において本質的に避けがたいものかどうかを調査すること。
  • 汚染サンプルを検出するために潜在空間のクラスタリングに依存する防御の脆弱性を露呈すること。
  • 高い攻撃成功率を維持しながら、潜在空間における検出可能なシグネチャを最小限に抑える適応的汚染攻撃を設計すること。
  • 既存の潜在空間分離性に基づく防御が、戦略的なトリガー設計とラベル付けによって効果的に回避可能であることを実証すること。
  • 潜在空間の分離性がバックドア攻撃の普遍的特徴であるという仮定を疑問視し、防御設計にあたっては慎重であるべきであることを主張すること。

提案手法

  • 正則化サンプルの導入:一部のバックドア付きサンプルを、ターゲットクラスではなく真の意味的クラスに正しくラベル付けすることで、トリガーとターゲットの相関への過剰適合を軽減する。
  • 非対称なトリガー植え付けの採用:正則化サンプルには弱く多様なトリガーを、攻撃サンプルには強力なトリガーを用いることで、モデルの一般化性能を向上させ、潜在空間におけるクラスタリングを低減する。
  • 潜在空間の分離性を抑制しつつもバックドア機能を維持するためのトレードオフをバランスさせることで、高い攻撃成功率(ASR)を維持する。
  • ベースモデルの潜在空間に対してクラスタリング解析を適用し、汚染サンプルとクリーンサンプルがもはや明確に分離されないことを検証する。
  • T-SNE可視化と再訓練実験を用いて、攻撃の隠密性と既存防御の失敗を評価する。
  • アブレーションスタディを実施し、正則化と非対称トリガーの貢献を分離し、両者が成功に不可欠であることを確認する。

実験結果

リサーチクエスチョン

  • RQ1潜在空間の分離性は、バックドア汚染攻撃において避けがたいシグネチャであるのか、それとも意図的に抑制可能であるのか?
  • RQ2潜在空間におけるクラスタ分離の検出に依存する防御を回避できるように、バックドア攻撃を設計できるか?
  • RQ3正しくラベル付けされた正則化サンプルは、汚染サンプルの潜在空間における識別可能性を低下させる役割を果たすか?
  • RQ4非対称なトリガー植え付けは、高い攻撃成功率と低い検出可能性の両方を達成するためにどのように寄与するか?
  • RQ5潜在空間分離性に基づく既存防御(例:SPECTRE や SCAn)が、潜在空間分離性を抑制する適応的攻撃に直面した際に、どの程度失敗するか?

主な発見

  • 提案された適応的攻撃は、高い攻撃成功率(例:CIFAR-10 で150個の汚染サンプルによる89.0%のASR)を達成しながら、潜在空間の分離性を抑制している。
  • SPECTRE や SCAn といった潜在空間クラスタリングに依存する防御は、攻撃が適用された場合、汚染サンプルを検出できず、再訓練後のASRがSPECTREで最低6.9%まで低下する。
  • アブレーションスタディにより、正則化サンプルと非対称トリガーの両方が不可欠であることが確認された。両者を除去すると、攻撃効果が著しく低下するか、検出可能性が上昇する。
  • 単に汚染率を減らす、あるいは正則化に依存するだけでは検出を回避できない。SPECTREが50個の汚染サンプルですら除去できたことからも明らかである。
  • 汚染率を低くしても攻撃は依然として効果的かつ隠密であるため、低データ汚染率が防御成功を保証するわけではない。
  • T-SNE可視化では、一部の潜在空間分布の違いは残っているものの、汚染クラスタとクリーンクラスタはもはや明確に分離されておらず、潜在空間分離性に基づく防御の基盤が揺るがされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。