Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Robustness of Streaming Algorithms through Importance Sampling

Vladimir Braverman, Avinatan Hassidim|arXiv (Cornell University)|Jun 28, 2021
Adversarial Robustness in Machine Learning参考文献 57被引用数 15
ひとこと要約

本稿では、重要度サンプリングとマージ・アンド・リダクションパラダイムを活用することで、回帰、クラスタリング、低ランク近似といった基本的な機械学習および数値線形代数のタスクに対する敵対的耐性を持つストリーミングアルゴリズムを導入する。重要度サンプリングに基づく手法は、スケッチベースの手法とは異なり、適応的敵対者に対して本質的に耐性を示すことが示され、サブラインア空間と多項対数的メモリを用いて高確率での耐性を達成する。これは、k-means、PCA、非負値行列分解といった問題に対して、新たなアルゴリズム的設計を伴わずに初めての結果である。

ABSTRACT

In this paper, we introduce adversarially robust streaming algorithms for central machine learning and algorithmic tasks, such as regression and clustering, as well as their more general counterparts, subspace embedding, low-rank approximation, and coreset construction. For regression and other numerical linear algebra related tasks, we consider the row arrival streaming model. Our results are based on a simple, but powerful, observation that many importance sampling-based algorithms give rise to adversarial robustness which is in contrast to sketching based algorithms, which are very prevalent in the streaming literature but suffer from adversarial attacks. In addition, we show that the well-known merge and reduce paradigm in streaming is adversarially robust. Since the merge and reduce paradigm allows coreset constructions in the streaming setting, we thus obtain robust algorithms for $k$-means, $k$-median, $k$-center, Bregman clustering, projective clustering, principal component analysis (PCA) and non-negative matrix factorization. To the best of our knowledge, these are the first adversarially robust results for these problems yet require no new algorithmic implementations. Finally, we empirically confirm the robustness of our algorithms on various adversarial attacks and demonstrate that by contrast, some common existing algorithms are not robust. (Abstract shortened to meet arXiv limits)

研究の動機と目的

  • ストリーミングアルゴリズムが、アルゴリズムの出力を観測して入力を調整する適応的敵対者に対して脆弱であるという問題に対処すること。
  • スケッチベースの手法とは対照的に、重要度サンプリングに基づくアルゴリズムが、敵対的ストリーミング攻撃に対して本質的に耐性を示すことを確立すること。
  • k-means、k-median、PCA、非負値行列分解といったコアな問題に対して、ストリーミングモデルで敵対的耐性を持つアルゴリズムを初めて提供すること。
  • マージ・アンド・リダクションパラダイムが、クラスタリングおよび次元削減タスクの広いクラスにわたる耐性のあるコアセット構築を可能にすることを示すこと。
  • 敵対的攻撃下でのアルゴリズムの耐性を実験的に検証するとともに、標準的なストリーミングアルゴリズムの脆さを示すこと。

提案手法

  • 重要度サンプリングを用いて、リッジスコアやエッジ接続性といった安定した統計量に基づくサンプリング確率で、ストリーミングデータに対する耐性のある推定器を構築する。
  • Freedmanの不等式を用いたマルティンゲールベースの解析により、敵対的エッジ挿入下でのカットスパースファイアの乖離を制限する。
  • マージ・アンド・リダクションフレームワークを用いて、再帰的にデータ構造を統合し、階層的集約ステップ全体にわたり耐性を保証する。
  • 重要度サンプリングが、スケッチ手法が内部のランダムネスを漏洩させるのとは異なり、適応的フィードバック下でも集中性の性質を保持することを活用する。
  • すべてのカットに対して高確率のカットスパースファイア保証を確保するため、パラメータ化されたサンプリングレート ρ = Ω((log n + log m)/ε²) を用いる。
  • すべての可能なカットに対してユニオンバウンズを適用し、サイズ ακ₁ のカット数に対する決定的バウンディング(n^{2α})を用いて、失敗確率を制御する。

実験結果

リサーチクエスチョン

  • RQ1適応的敵対者(アルゴリズムの出力を観測し、それに応じて入力を調整する者)に対して、重要度サンプリングに基づくストリーミングアルゴリズムが、証明可能な耐性を示せるか?
  • RQ2なぜスケッチベースのアルゴリズムは敵対的ストリーミング下で失敗するのに対し、重要度サンプリングベースのものは耐性を保つのか?
  • RQ3マージ・アンド・リダクションパラダイムを用いて、クラスタリングおよび次元削減タスクのための敵対的耐性コアセットを構築できるか?
  • RQ4コアアルゴリズム的プリミティブを再設計することなく、ストリーミングモデルでk-means、k-median、PCAに対する敵対的耐性を達成できるか?
  • RQ5敵対的ストリーミング環境下で高確率の耐性を保証するために、最小限のメモリおよびサンプリングオーバーヘッドはどれほど必要か?

主な発見

  • 重要度サンプリングに基づくアルゴリズムは、スケッチベースの手法とは異なり、内部ランダムネスの漏洩により、敵対的ストリーミングに対して本質的に耐性を示す。
  • 本稿は、ストリーミングモデルにおいて、k-means、k-median、k-center、Bregmanクラスタリング、プロジェクティブクラスタリング、PCA、非負値行列分解に対する敵対的耐性を持つアルゴリズムを初めて確立した。
  • サブラインア空間と多項対数的メモリを用いて、新たなアルゴリズム的設計を伴わず、標準的な重要度サンプリングとマージ・アンド・リダクションのみで耐性を達成した。
  • ρ = Ω((log n + log m)/ε²) のとき、失敗確率は 1/poly(n) で抑えられ、高確率での正しさが保証される。
  • 実験的評価により、提案されたアルゴリズムが敵対的攻撃下でも正確に保たれる一方で、標準的なアルゴリズムは同様の条件下で失敗することが確認された。
  • 解析により、耐性のあるスパースファイア H のエッジ数は最適値の O(κ² log n / ε²) 倍であることが示された。ここで κ = κ₂/κ₁ は最大カットサイズと最小カットサイズの比である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。