Skip to main content
QUICK REVIEW

[論文レビュー] Neural Polarizer: A Lightweight and Effective Backdoor Defense via Purifying Poisoned Features

Mingli Zhu, Shaokui Wei|arXiv (Cornell University)|Jun 29, 2023
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

本稿では、背後特徴をフィルタリングしながら健全な特徴を保持するように学習可能な線形変換層を背後特徴モデルに挿入する、軽量なバックドア防御手法であるNeural Polarizerを提案する。バイレベル最適化問題を解くことで、全モデルの微調整なしに汚染された入力を浄化する。この手法により、最小限の健全データと低コストな計算量で最先端の防御性能を達成する。

ABSTRACT

Recent studies have demonstrated the susceptibility of deep neural networks to backdoor attacks. Given a backdoored model, its prediction of a poisoned sample with trigger will be dominated by the trigger information, though trigger information and benign information coexist. Inspired by the mechanism of the optical polarizer that a polarizer could pass light waves with particular polarizations while filtering light waves with other polarizations, we propose a novel backdoor defense method by inserting a learnable neural polarizer into the backdoored model as an intermediate layer, in order to purify the poisoned sample via filtering trigger information while maintaining benign information. The neural polarizer is instantiated as one lightweight linear transformation layer, which is learned through solving a well designed bi-level optimization problem, based on a limited clean dataset. Compared to other fine-tuning-based defense methods which often adjust all parameters of the backdoored model, the proposed method only needs to learn one additional layer, such that it is more efficient and requires less clean data. Extensive experiments demonstrate the effectiveness and efficiency of our method in removing backdoors across various neural network architectures and datasets, especially in the case of very limited clean data.

研究の動機と目的

  • 既存のトレーニング後バックドア防御が大量の健全データと高コストな計算を要するという限界を是正すること。
  • バックドアトレーサー特徴を特定的にフィルタリングしながら、健全な特徴表現を保持する防御メカニズムを開発すること。
  • モデルの微調整を最小限に抑えるために、追加の1層のみを学習することで計算コストを低減すること。
  • 特に僅かな健全サンプルしか入手できないような低データ環境下でも頑健性を確保すること。
  • 元のモデルパラメータを変更しない軽量でモジュラーな防御層の新しいパラダイムを提起すること。

提案手法

  • 学習可能なニューラルポーラライザーを背後特徴モデルの途中層として挿入し、トレーサー関連の活性化を抑制する特徴フィルターとして機能させる。
  • ニューラルポーラライザーは、1×1畳み込み層に続くバッチ正則化を用いて軽量な線形変換として実装される。
  • バイレベル最適化フレームワークを定式化する:上位最適化はポーラライザーを最適化してバックドア成功率を最小化し、健全な正確度を最大化する。下位最適化はモデルの信頼度を用いてターゲットラベルを推定する。
  • トレーニング中に汚染された入力を模擬するために、ターゲット攻撃的摂動を用いてトレーサーを近似する。
  • この手法では、背後特徴モデルのすべての層を固定したまま、ポーラライザーのパラメータのみを更新するため、効率性が保証される。
  • 限られた健全データセットを用いて防御をトレーニングするため、希少な健全データを伴う実世界の展開において実用的である。

実験結果

リサーチクエスチョン

  • RQ1全ネットワークの微調整なしに、軽量で学習可能な層が背後特徴モデル内の汚染された特徴を効果的に浄化できるか?
  • RQ2わずかな数の健全サンプルしか入手できない状況で、提案手法はどの程度の性能を示すか?
  • RQ3多様な攻撃とアーキテクチャにおいて、ニューラルポーラライザーはバックドア成功率を著しく低下させつつ、高い健全正確度を維持できるか?
  • RQ4低データおよび高複雑性設定下で、既存のトレーニング後防御と比較して、この手法の効率性と頑健性はどの程度か?
  • RQ5直接的なトレーサーまたはラベルにアクセスできない状況でも、バイレベル最適化フレームワークは効果的にポーラライザーを学習できるか?

主な発見

  • ResNet-18を用いたCIFAR-10において、500個の健全サンプルのみを用いて94.09%の防御効果(DER)を達成し、i-BAUおよびANPを上回った。
  • 50個の健全サンプルのみで、BadNets-A2Oでは92.37%のDERを維持し、低データ環境下での強力な頑健性を示した。
  • PreActResNet18において、50エポックで55.16秒の実行時間であり、i-BAU(57.23秒、5エポック)および他のベースラインを上回るスピードを達成した。
  • WaNet攻撃において、250個の健全サンプルを用いて97.12%のDERを達成し、同じ条件下でi-BAU(88.29%)およびANP(80.17%)を著しく上回った。
  • 汚染率の変動にかかわらず安定した性能を示し、汚染率が上昇してもわずかに正確度が低下するにとどまり、データ汚染度に対する耐性を示した。
  • 背後特徴の成功率(ASR)を2%未満に低下させつつ、高い健全正確度(例:500個の健全サンプルでBadNets-A2Oで87.58%)を維持したため、効果的なバックドア緩和が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。