[論文レビュー] Training with More Confidence: Mitigating Injected and Natural Backdoors During Training
この論文は、分段線形活性化関数に起因するハイパーサブスペース意思決定領域を特定・排除することで、インジェクションされたバックドアおよび自然発生的バックドアの両方を緩和する、新しいトレーニング手法NONEを提案する。トレーニング中にこのようなハイパーサブスペースを形成するニューロンを特定・抑制することで、標準的な汚染攻撃では攻撃成功率(ASR)を54.83倍低減し、自然発生的バックドアでは1.75倍低減する。5つのデータセットおよび複数の攻撃タイプにおいて、既存の防御手法を上回る性能を発揮する。
The backdoor or Trojan attack is a severe threat to deep neural networks (DNNs). Researchers find that DNNs trained on benign data and settings can also learn backdoor behaviors, which is known as the natural backdoor. Existing works on anti-backdoor learning are based on weak observations that the backdoor and benign behaviors can differentiate during training. An adaptive attack with slow poisoning can bypass such defenses. Moreover, these methods cannot defend natural backdoors. We found the fundamental differences between backdoor-related neurons and benign neurons: backdoor-related neurons form a hyperplane as the classification surface across input domains of all affected labels. By further analyzing the training process and model architectures, we found that piece-wise linear functions cause this hyperplane surface. In this paper, we design a novel training method that forces the training to avoid generating such hyperplanes and thus remove the injected backdoors. Our extensive experiments on five datasets against five state-of-the-art attacks and also benign training show that our method can outperform existing state-of-the-art defenses. On average, the ASR (attack success rate) of the models trained with NONE is 54.83 times lower than undefended models under standard poisoning backdoor attack and 1.75 times lower under the natural backdoor attack. Our code is available at https://github.com/RU-System-Software-and-Security/NONE.
研究の動機と目的
- インジェクションおよび自然発生的バックドアの両方を同時に緩和できない既存の防御に起因する深刻な脅威に対処すること。
- 特にReLuなどの分段線形活性化関数に関連する、バックドアに起因するハイパーサブスペース意思決定領域の根本的要因を特定すること。
- トレーニング時における前向きな防御を設計し、モデルの再トレーニングや事後分析を必要とせずに、このようなハイパーサブスペースの形成を防止すること。
- 適応的攻撃およびフェデレーテッド学習やトランスファー学習を含む実世界の展開環境においても、耐性を確保すること。
提案手法
- 攻撃されたすべてのラベルにわたる入力空間におけるハイパーサブスペースを形成するニューロンを、トロイの木馬のトリガー領域に対応するものとして特定する。
- 分段線形活性化関数(例:ReLU)が、重みとバイアスがニューロン入力を単一の部分関数に制限する場合、線形意思決定境界を誘発するという性質を活用する。
- トレーニング中に活性化値をモニタリングし、多様な入力に対して一貫して単一の線形領域に位置する前活性化値を持つニューロンを抑制する。
- 信頼度に基づくプルーニング機構を適用し、ハイパーサブスペース意思決定領域に寄与するニューロンを削除することで、トロイの木馬の分類表面を排除する。
- クリーンデータのアクセスやモデルのファインチューニングを必要とせず、標準的なトレーニングパイプラインに統合可能であり、リアルタイムでの緩和が可能である。
- 汚染されたサンプルの活性化に基づく同定とハイパーサブスペース検出を用いて評価し、複数のモデル(NiN, VGG16, ResNet18)および攻撃タイプ(BadNetsやラベル一貫性攻撃を含む)において、悪意のあるニューロン同定の精度と再現率が98%以上を達成する。
実験結果
リサーチクエスチョン
- RQ1明示的なデータ汚染が存在しない状況でも、なぜDNNがバックドアトリガーに対応するハイパーサブスペース意思決定領域を発展させるのか?
- RQ2分段線形活性化関数の使用が、入力空間におけるこのようなハイパーサブスペース領域の形成にどのように寄与するのか?
- RQ3トレーニング時に、モデルがバックドア行動を学習する前に、このようなハイパーサブスペース領域を検出・排除できる防御を設計できるか?
- RQ4データフィルタリングや事後分析に依存せずに、インジェクションおよび自然発生的バックドアの両方を効果的に緩和できる防御は可能か?
- RQ5フェデレーテッド学習やトランスファー学習を含む多様なトレーニング設定において、この防御はどのように一般化するか?
主な発見
- 標準的なデータ汚染攻撃において、5つのデータセットにわたる未防御モデルと比較して、NONEは攻撃成功率(ASR)を54.83倍低減する。
- 自然発生的バックドアの状況では、未防御モデルと比較してASRを1.75倍低減し、意図しないトロイの木馬に対しても有効であることを示す。
- 複数のモデル(NiN, VGG16, ResNet18)および攻撃タイプ(BadNetsやラベル一貫性攻撃を含む)において、汚染されたサンプルの同定において98%以上の精度と再現率を達成する。
- 10名の参加者(うち4名が悪意ある)を含むフェデレーテッド学習環境では、NONEはASRを31.16倍低減し、MNISTでは98.60%、CIFAR-10では78.67%のテスト精度を維持する。
- トランスファー学習環境では、NONEは未防御モデルと比較してわずか2.00%の精度低下で、ASRを4.00%まで低減する。
- ゆっくりとデータを汚染する適応的攻撃に対しても、防御は有効である。これは、行動的差異に依存するのではなく、ハイパーサブスペース形成という構造的要因を標的としているためである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。