[論文レビュー] Backdoor Defense via Adaptively Splitting Poisoned Dataset
本稿では、損失誘導およびメタラーニングにインspiredされた分割を用いて、汚染されたデータセットを継続的にクリーンデータプールと汚染データプールに分割する訓練時バックドア防御であるAdaptive Splitting Defense (ASD)を提案する。ASDは複数のベンチマークで高いクリーン精度を維持しながら、6つのSOTAバックドア攻撃に対して最先端の耐性を示し、従来の手法に比べて防御効果と効率性の両面で優れている。
Backdoor defenses have been studied to alleviate the threat of deep neural networks (DNNs) being backdoor attacked and thus maliciously altered. Since DNNs usually adopt some external training data from an untrusted third party, a robust backdoor defense strategy during the training stage is of importance. We argue that the core of training-time defense is to select poisoned samples and to handle them properly. In this work, we summarize the training-time defenses from a unified framework as splitting the poisoned dataset into two data pools. Under our framework, we propose an adaptively splitting dataset-based defense (ASD). Concretely, we apply loss-guided split and meta-learning-inspired split to dynamically update two data pools. With the split clean data pool and polluted data pool, ASD successfully defends against backdoor attacks during training. Extensive experiments on multiple benchmark datasets and DNN models against six state-of-the-art backdoor attacks demonstrate the superiority of our ASD. Our code is available at https://github.com/KuofengGao/ASD.
研究の動機と目的
- 信頼できない第三者のデータで訓練された深層ニューラルネットワークにおけるバックドア攻撃という重要な課題に対処すること。
- 汚染されたデータセットをクリーンプールと汚染プールに適応的・動的に分割できるように、既存の訓練時防御を改善すること。
- 分割されたデータプールにおける半教師あり学習を活用することで、汚染のリスクを低減し、モデルの性能を維持すること。
- 再訓練にかかるコストを回避し、訓練中にバックドア漏洩を最小限に抑える、高速でエンドツーエンドの防御を構築すること。
- 複数のデータセットおよびモデルにおいて、多様なバックドア攻撃に対して優れた耐性を示し、高いクリーン精度を維持できることを実証すること。
提案手法
- 汚染されたデータセットをクリーン(ラベルあり)と汚染(ラベルなし)の2つのプールに分割する統合的フレームワークを提案する。
- サンプルの損失の大きさに基づいて、初期化段階で高速で損失誘導型の分割手法を導入する。
- クリーンで難しいサンプル(損失だけでは区別が難しい)を汚染されたものから効果的に分離できる、新しいメタラーニングにインspiredされた分割(メタスプリット)技術を開発する。
- 2つの分割プールに半教師あり学習を適用する:クリーンプールでは教師あり学習、汚染プールでは自己学習を実施し、意味的特徴を保持する。
- 初期化にクラスあたり10個のクリーンシードサンプルのみを用いることで、転移学習の拡張が可能になり、大規模なクリーンデータへの依存を低減する。
- 訓練中に損失誘導およびメタスプリットの両更新を通じて、プール構成を動的に適応させ、分離精度と耐性を向上させる。
実験結果
リサーチクエスチョン
- RQ1汚染されたデータセットをクリーンプールと汚染プールに分割することで、訓練時バックドア防御の統合的フレームワークを確立できるか?
- RQ2損失のみでは区別が難しいクリーンで難しいサンプルを、汚染されたものから効果的に分離するにはどうすればよいか?
- RQ3適応的分割戦略は、高いクリーン精度を維持しながら防御の耐性を向上させられるか?
- RQ4ABL や DBD といった既存の防御と比較して、ASD の性能(精度と攻撃成功率)はどのように異なるか?
- RQ5再訓練にかかる費用が大きくなく、クリーンデータの事前知識が不要なエンドツーエンドの実装が可能か?
主な発見
- ASDは、CIFAR-10、GTSRB、ImageNet、VGGFace2で6つのSOTAバックドア攻撃に対して、最先端の防御性能を達成した。
- CIFAR-10では、BadNetsに対して93.8%のクリーン精度、Blendに対して90.9%のクリーン精度を維持し、ABL や DBD を顕著に上回った。
- VGGFace2におけるWaNet攻撃では、ASDは53.0%のクリーン精度とたった3.1%のASRを達成し、強い耐性を示した。
- メタスプリット部は、ABL や DBD との損失分布比較によって、クリーンで難しいサンプルを効果的に汚染されたものから分離できていることが示された。
- 汚染プールにおける半教師あり学習を活用することで、直接的なアンラーニングを避けることでバックドア漏洩のリスクを低減した。
- 防御は効率的かつスケーラブルであり、クラスあたり10個のクリーンシードサンプルのみを必要としており、実世界への展開に実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。