Skip to main content
QUICK REVIEW

[論文レビュー] Regularization Helps with Mitigating Poisoning Attacks: Distributionally-Robust Machine Learning Using the Wasserstein Distance

Farhad Farokhi|arXiv (Cornell University)|Jan 29, 2020
Risk and Portfolio Optimization参考文献 32被引用数 5
ひとこと要約

本稿では、データ汚染攻撃への耐性を高めるために Wasserstein 距離を用いた分布的に頑健な機械学習フレームワークを提案する。モデルパラメータの双対ノルムを正則化項として組み込んだ正則化最適化問題として定式化することで、敵対的汚染下でも継続的に良好な一般化性能を達成できることを保証する。本手法は、実世界のデータセットを用いた回帰および分類タスクにおいて、優れた頑健性を示す。

ABSTRACT

We use distributionally-robust optimization for machine learning to mitigate the effect of data poisoning attacks. We provide performance guarantees for the trained model on the original data (not including the poison records) by training the model for the worst-case distribution on a neighbourhood around the empirical distribution (extracted from the training dataset corrupted by a poisoning attack) defined using the Wasserstein distance. We relax the distributionally-robust machine learning problem by finding an upper bound for the worst-case fitness based on the empirical sampled-averaged fitness and the Lipschitz-constant of the fitness function (on the data for given model parameters) as regularizer. For regression models, we prove that this regularizer is equal to the dual norm of the model parameters. We use the Wine Quality dataset, the Boston Housing Market dataset, and the Adult dataset for demonstrating the results of this paper.

研究の動機と目的

  • 正則化が機械学習におけるデータ汚染攻撃に対してなぜ効果を発揮するのか、その一般理論的根拠が不足しているという問題に取り組む。
  • 敵対的訓練データの汚染があっても、継続的に綺麗なデータにおけるモデル性能を保証する分布的に頑健な学習フレームワークを開発する。
  • Wasserstein 距離とリプシッツ定数正則化を用いて、分布的に頑健な最適化問題を解釈可能で実行可能な形に再定式化する。
  • 実世界のデータセットを用いたラベル反転攻撃およびデータ変更攻撃に対して、提案手法の頑健性を実験的に検証する。
  • サポートベクターマシンにとどまらない一般線形回帰およびロジスティック回帰モデルへの正則化の理論的理解を拡張する。

提案手法

  • 汚染された訓練データの経験的分布を中心とする Wasserstein ボール上での最悪期待適合度を最適化することで、分布的に頑健な機械学習問題を定式化する。
  • データ入力に対する適合関数のリプシッツ定数を用いて、最悪期待適合度の上界を経験的平均適合度と結びつける。
  • リプシッツ定数を正則化項として追加することで、分布的に頑健な問題を正則化された経験的リスク最小化問題に緩和する。
  • 線形回帰に対して、正則化項がモデルパラメータの双対ノルムに等しくなることを証明し、効率的な最適化を可能にする。
  • 線形回帰(Wine Quality、Boston Housing)およびロジスティック回帰(Adult データセット)に、ラベル反転およびデータ変更攻撃を適用して手法を適用する。
  • 基本ノルムとして 2-ノルムを用い、双対ノルムも 2-ノルムとなるようにすることで、正則化項を目的関数内に ∥θ∥₂² として簡略化する。

実験結果

リサーチクエスチョン

  • RQ1正則化がサポートベクターマシンを超えて、なぜデータ汚染攻撃に対して効果を発揮するのか?
  • RQ2Wasserstein 距離を用いた分布的に頑健な最適化は、汚染攻撃下でも継続的に綺麗なデータにおける性能保証を提供できるか?
  • RQ3分布的に頑健な最適化問題を、実行可能な正則化学習問題にどのように再定式化できるか?
  • RQ4線形回帰モデルの文脈において、正則化項の解析的形は何か?
  • RQ5提案手法は、実際のラベル反転およびデータ変更攻撃に対して、どの程度の頑健性向上を達成できるか?

主な発見

  • 提案された正則化学習フレームワークは、ラベル反転およびデータ変更攻撃の両方において、特に攻撃強度が高まる(β > 10%)状況で、継続的に継続的なテスト性能の向上を示している。
  • Wine Quality データセットにおいて、β = 20% の条件下で、データ変更攻撃に対して正則化モデルは非正則化モデルよりも最大30%高いテスト精度を達成した。
  • Boston Housing Market データセットでは、全攻撃レベルにおいて正則化モデルがベースラインより低いテスト誤差(平均二乗誤差)を維持し、β = 15% 時に25%の改善を示した。
  • Adult データセットにおいて、提案された正則化を施したロジスティック回帰は、β = 10% 時にラベル反転攻撃下で非正則化モデルよりも15%高い F1 スコアを達成した。
  • 正則化による性能向上は、攻撃強度が高くなるほど顕著に現れ、敵対的データ汚染に対して本手法の頑健性が裏付けられた。
  • 線形回帰において、モデルパラメータの双対ノルムが正則化項として正確に機能し、明確で解釈可能な正則化項を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。