[論文レビュー] Deep Partition Aggregation: Provable Defense against General Poisoning Attacks
本稿では、一般のポイズニング攻撃およびラベル反転攻撃の両方に対して、それぞれ新たな保証可能な防御手法であるDeep Partition Aggregation (DPA) および Semi-Supervised DPA (SS-DPA) を提案する。DPAは訓練データのハッシュ化された部分集合に学習させたアンサンブルモデルを用いることで、証明可能なロバスト性保証を提供する。具体的には、MNISTのテスト画像の少なくとも50%が500個を超えるポイズン挿入に対してロバストであることを保証し、CIFAR-10では9枚の画像が9回の挿入に対してロバストであることを保証する。一方、SS-DPAはMNISTで600個を超えるラベル反転、CIFAR-10で300個を超えるラベル反転に耐えられるよう、先行研究を上回る性能を示す。
Adversarial poisoning attacks distort training data in order to corrupt the test-time behavior of a classifier. A provable defense provides a certificate for each test sample, which is a lower bound on the magnitude of any adversarial distortion of the training set that can corrupt the test sample's classification. We propose two novel provable defenses against poisoning attacks: (i) Deep Partition Aggregation (DPA), a certified defense against a general poisoning threat model, defined as the insertion or deletion of a bounded number of samples to the training set -- by implication, this threat model also includes arbitrary distortions to a bounded number of images and/or labels; and (ii) Semi-Supervised DPA (SS-DPA), a certified defense against label-flipping poisoning attacks. DPA is an ensemble method where base models are trained on partitions of the training set determined by a hash function. DPA is related to both subset aggregation, a well-studied ensemble method in classical machine learning, as well as to randomized smoothing, a popular provable defense against evasion attacks. Our defense against label-flipping attacks, SS-DPA, uses a semi-supervised learning algorithm as its base classifier model: each base classifier is trained using the entire unlabeled training set in addition to the labels for a partition. SS-DPA significantly outperforms the existing certified defense for label-flipping attacks on both MNIST and CIFAR-10: provably tolerating, for at least half of test images, over 600 label flips (vs. < 200 label flips) on MNIST and over 300 label flips (vs. 175 label flips) on CIFAR-10. Against general poisoning attacks, where no prior certified defenses exists, DPA can certify >= 50% of test images against over 500 poison image insertions on MNIST, and nine insertions on CIFAR-10. These results establish new state-of-the-art provable defenses against poisoning attacks.
研究の動機と目的
- 攻撃者が訓練データに制限付きの数のサンプルを挿入または削除できる一般のポイズニング攻撃に対して、保証可能な防御を構築すること。
- ラベル反転攻撃に対する既存の保証可能な防御を改善し、より高いロバスト性の閾値を達成すること。
- 訓練サンプルやラベルに対する任意の歪み(ラベル反転、サンプル挿入など)に対しても、依然としてロバストである保証可能な防御を設計すること。
- アンサンブル学習と半教師付き学習を活用し、データ分布に関する最小限の仮定で、強力な認証保証を達成すること。
- 高いクリーン精度を維持しながら、個々のテストサンプルに対して検証可能なロバスト性証明を提供する実用的でスケーラブルな防御を提供すること。
提案手法
- DPAは、入力サンプルにハッシュ関数を適用して得られるパーティションに分けた訓練セットの各不重複部分集合に対して学習された基本分類器のアンサンブルを構築する。
- 最終的な予測は、すべての基本分類器における多数決によって行われ、認証は、摂動に対して予測が一貫するパーティションの最小数に基づいて導出される。
- SS-DPAでは、各基本分類器が全未ラベル付き訓練データと、自身の割り当てられたパーティション内のラベル付きサンプルのみを用いて学習されるため、より良い特徴学習とロバスト性が達成される。
- 認証メカニズムは、アンサンブルの構造と各パーティション間でのラベルの一貫性を用いて、最終予測を変更するために必要なラベル反転またはサンプル挿入の下限を計算する。
- 同じサンプルに影響を与えるラベル反転は、サンプル値に基づく一貫性のあるパーティショニングのおかげで、認証において1つの摂動として扱われる。
- このフレームワークは、教師ありおよび自己教師あり表現学習(例:SimCLR)と互換性があり、特徴品質とロバスト性の両方を向上させる。
実験結果
リサーチクエスチョン
- RQ1サンプルの挿入・削除、およびラベルや特徴の操作を含む一般のポイズニング攻撃に対して、保証可能な防御を構築できるか?
- RQ2アンサンブル手法をどのように変更すれば、データ分布に関する最小限の仮定で、ポイズニング攻撃に対して保証可能なロバスト性を提供できるか?
- RQ3半教師付き学習は、完全に教師ありベースラインと比較して、ラベル反転攻撃に対する保証可能な防御のロバスト性を向上させられるか?
- RQ4多数のテスト画像に対して正しい予測を保証できるラベル反転の最大数は何か?
- RQ5基本モデルアーキテクチャおよび表現学習手法の選択が、DPAおよびSS-DPAの認証性能にどのように影響を与えるか?
主な発見
- DPAは、MNISTのテスト画像の少なくとも50%が500個を超えるポイズン挿入に対してロバストであることを保証し、一般のポイズニング攻撃に対する先行研究を著しく上回る性能を示す。
- CIFAR-10では、DPAが少なくとも9%のテスト画像に対して9回の挿入に対してロバストであることを保証し、高次元設定でも強力な証明可能なロバスト性を示している。
- SS-DPAは、MNISTで600個を超えるラベル反転、CIFAR-10で300個を超えるラベル反転に対して保証可能なロバスト性を達成し、それぞれ200および175回の反転を耐えられる前例の最先端技術を上回っている。
- ヒストограм等化を前処理として用いることで、GTSRBにおけるDPAの性能が向上し、特にベース分類器の数をk=100に増やすと、照明の変動に対する処理が改善される。
- DPAでは、ベース分類器の数(k)を増やすことで、クリーン精度と認証ロバスト性の両方が向上し、k=100でGTSRBで77.81%のクリーン精度と21の中央値認証ロバスト性を達成する。
- SS-DPAは、MNISTで89.20%の高いクリーン精度と中央値20の認証ロバスト性を維持しながら、Rosenfeldら(2020)と比較して、すべての攻撃サイズにおいて顕著に高い認証精度を達成している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。