Skip to main content
QUICK REVIEW

[論文レビュー] Improved Certified Defenses against Data Poisoning with (Deterministic) Finite Aggregation

Wenxiao Wang, Alexander Levine|arXiv (Cornell University)|Feb 5, 2022
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

本論文は、重複する基本分類器の間で訓練サンプルを戦略的に再利用することにより、汚染された訓練データに対する耐性を高める、認証可能防御である Finite Aggregation を提案する。データを小さな非交差部分集合に分割し、その後、より大きな非交差部分集合に重複を含む形で再配布することで、汚染されたサンプルの最悪ケース影響を低減する。これにより、SOTA(最先端)の認証可能耐性を達成し、GTSRB では認証可能割合を最大で 4.77% 向上させつつ、DPA のクリーンな正確性を維持した。

ABSTRACT

Data poisoning attacks aim at manipulating model behaviors through distorting training data. Previously, an aggregation-based certified defense, Deep Partition Aggregation (DPA), was proposed to mitigate this threat. DPA predicts through an aggregation of base classifiers trained on disjoint subsets of data, thus restricting its sensitivity to dataset distortions. In this work, we propose an improved certified defense against general poisoning attacks, namely Finite Aggregation. In contrast to DPA, which directly splits the training set into disjoint subsets, our method first splits the training set into smaller disjoint subsets and then combines duplicates of them to build larger (but not disjoint) subsets for training base classifiers. This reduces the worst-case impacts of poison samples and thus improves certified robustness bounds. In addition, we offer an alternative view of our method, bridging the designs of deterministic and stochastic aggregation-based certified defenses. Empirically, our proposed Finite Aggregation consistently improves certificates on MNIST, CIFAR-10, and GTSRB, boosting certified fractions by up to 3.05%, 3.87% and 4.77%, respectively, while keeping the same clean accuracies as DPA's, effectively establishing a new state of the art in (pointwise) certified robustness against data poisoning.

研究の動機と目的

  • 汚染された訓練データによってモデルの挙動が操作されるという脅威が増大する中、その脅威に対処すること。
  • DPA(Deep Partition Aggregation)という、先行する決定的認証可能防御を、クリーンな正確性を損なわずに耐性を向上させること。
  • 基本分類器の間で訓練サンプルを戦略的に再利用することで、一般の汚染攻撃に対してより強い証明可能な耐性を提供する手法を開発すること。
  • 決定的および確率的集約ベースの防御の設計ギャップを埋め、認証可能耐性について統一的な視点を提供すること。
  • 複数のベンチマークデータセットにおいて、データ汚染防御におけるポイントワイズ認証可能耐性の新しい最良状態を確立すること。

提案手法

  • ハイパーパrameter k と d を用いて、ハッシュ関数 h_split を用いて訓練データセットを kd 個の非交差部分集合に分割する。
  • 2番目のハッシュ関数 h_spread を用いて、各部分集合を d 個の異なる部分集合に再配布し、kd 個の重複する訓練部分集合を生成する。
  • 各部分集合に対して1つの基本分類器を訓練することで、kd 個の全分類器を構築し、訓練サンプルを構造的かつ重複的に共有する。
  • 推論時、すべての kd 個の分類器の予測結果を多数決によって統合し、アンサンブルの耐性を活用して汚染されたサンプルの影響を制限する。
  • 理論的分析により、任意の汚染されたサンプルに対する正規化マージン感度は O(1/k) のスケーリングを示し、最悪ケースの影響が低減することが分かった。
  • d の増加により、投票における同点解消の頻度が低下し、耐性が向上し、攻撃下でも高い認証可能割合を維持するのに寄与する。

実験結果

リサーチクエスチョン

  • RQ1集約ベースの防御において、重複する訓練部分集合が非交差部分集合よりも、データ汚染攻撃に対する認証可能耐性を向上させられるか?
  • RQ2複数の基本分類器の間で訓練サンプルを戦略的に再利用することで、汚染されたサンプルの最悪ケース影響にどのような影響を与えるか?
  • RQ3DPA のような決定的集約手法が、確率的手法と同等またはそれを上回る耐性を達成できるか、その程度は?
  • RQ4ハイパーパrameter k と d を変化させた場合、計算コスト、耐性、クリーンな正確性とのトレードオフはどのようなものか?
  • RQ5集約ベースの防御において、ポイントワイズ認証可能耐性(認証可能割合)と分布的耐性(認証可能正確性)は、実験的にどのように比較されるか?

主な発見

  • Finite Aggregation は、DPA と比較して、MNIST で最大 3.05%、CIFAR-10 で最大 3.87%、GTSRB で最大 4.77% の認証可能割合の向上を達成し、ポイントワイズ認証可能耐性において新たな SOTA を樹立した。
  • 本手法は、すべてのデータセットで DPA と同等のクリーンな正確性を維持しており、クリーンデータに対する性能を犠牲にすることなく耐性が向上したことを確認した。
  • d の増加により、ベース分類器の正確性が低下することなく耐性が向上する。これは、平均的な部分集合サイズが一定のまま維持されるためである。
  • d を大きくすることで、多数決投票における同点解消が減少し、特に攻撃サイズが大きい場合に顕著に認証可能割合の向上が見られた。
  • 理論的分析により、汚染されたサンプルに対する感度は O(1/k) のスケーリングに従うことが確認され、k を大きくすることで耐性向上が裏付けられた。
  • 実験的比較により、認証可能割合は常に認証可能正確性より低く、ポイントワイズ耐性と分布的耐性の違いが顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。