Skip to main content
QUICK REVIEW

[論文レビュー] Resilience: A Criterion for Learning in the Presence of Arbitrary Outliers

Jacob Steinhardt, Moses Charikar|arXiv (Cornell University)|Mar 15, 2017
Machine Learning and Algorithms参考文献 15被引用数 17
ひとこと要約

本稿では、任意の外れ値を含む高次元データにおけるロバストな学習のための一般的基準として、レジリエンス(耐性)を導入する。データがレジリエンス的である—つまり、任意の大規模な部分集合の平均が全体の平均に近い—場合、敵対的に破損したデータが定数割合以下である場合でも、平均などのパラメータの正確な推定が可能であることが示される。主な貢献は、最小限の仮定のもとで次元に依存しないロバスト推定を可能にする新しい理論的枠組みの構築であり、平均推定、分布学習、スチュアティックブロックモデルへの応用を含む。

ABSTRACT

We introduce a criterion, resilience, which allows properties of a dataset (such as its mean or best low rank approximation) to be robustly computed, even in the presence of a large fraction of arbitrary additional data. Resilience is a weaker condition than most other properties considered so far in the literature, and yet enables robust estimation in a broader variety of settings. We provide new information-theoretic results on robust distribution learning, robust estimation of stochastic block models, and robust mean estimation under bounded $k$th moments. We also provide new algorithmic results on robust distribution learning, as well as robust mean estimation in $\ell_p$-norms. Among our proof techniques is a method for pruning a high-dimensional distribution with bounded $1$st moments to a stable "core" with bounded $2$nd moments, which may be of independent interest.

研究の動機と目的

  • 敵対的外れ値を含む高次元設定におけるロバスト推定を可能にする、一般的で単純な基準を特定すること。
  • 有界k次のモーメント、離散分布、スチュアティックブロックモデルを含む分布のロバスト学習における情報理論的限界を提供すること。
  • ℓpノルムにおけるロバスト平均推定およびレジリエンス下での離散分布学習のための効率的アルゴリズムを開発すること。
  • プルーニング技術を用いて、レジリエンスと有界分散を持つ安定したコアの存在との関係を確立すること。
  • 従来の仮定よりも弱く、より広く適用可能な条件を導入することで、ロバスト推定に関する先行研究を統一的かつ一般化すること。

提案手法

  • 任意の大規模な部分集合の平均が全体の平均に近いという性質として、データセットのレジリエンスを定義し、部分集合の偏差にノルムの上限を課えることで形式化する。
  • ミニマックス双対性とカチンチェの不等式を用いて、第一モーメントが有界なレジリエンス集合が第二モーメントが有界なコアを含むことを証明する。
  • ノルムの強い凸性を活用して、有界分散を持つ大きなコアの存在を保証し、アルゴリズム的応用を可能にする。
  • コア抽出技術を応用して、ℓpノルムにおけるロバスト平均推定および離散分布学習のための効率的アルゴリズムを導出する。
  • パワー法を用いてレジリエンスを反復的に強化し、初期データが第一モーメントのみ有界であってもロバスト性を達成可能にする。
  • レジリエンスが敵対的汚染に対してロバストであることを証明し、次元に依存しない誤差バウンドを、弱い条件下でも達成可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1任意の外れ値を含む高次元データにおける平均のロバスト推定を保証する、一般的で単純な基準を定式化できるか?
  • RQ2どのような条件下で、重い尾を持つ、または高次元構造を持つデータであっても、次元に依存しない誤差でロバスト平均推定が達成可能か?
  • RQ3第一モーメントが有界なデータセットを、有界分散を持つ安定したコアへと変換する方法は何か? これにより効率的アルゴリズムが可能になるか?
  • RQ4レジリエンスと、有界モーメントやサブガウスィアン尾尾のような既存のロバスト性基準との関係は何か?
  • RQ5レジリエンスを用いて、離散分布やスチュアティックブロックモデルのロバスト学習のための効率的アルゴリズムを導出可能か?

主な発見

  • レジリエンスは、有界k次のモーメントやサブガウスィアン性よりも弱い条件であるが、より広い条件下でロバスト推定を可能にする。
  • 任意のノルムにおいて第一モーメントが有界な集合について、ノルムがγ-強く凸である場合、元の集合の半分以上を占めるコアが存在し、その分散は32σ²/γで有界である。
  • 元の分布がレジリエンス的である場合、ℓpノルムにおけるロバスト平均推定は、次元に依存せず誤差O(ε)で達成可能である。
  • 本稿では、レジリエンスが第二モーメントが有界な安定したコアの存在を示し、これによりアルゴリズム的応用が可能であることを確立した。
  • 離散分布に関しては、レジリエンス条件の下で、効率的な多項式時間アルゴリズムによるロバスト学習が達成可能である。
  • 本フレームワークは、有界k次のモーメントを持つ分布およびスチュアティックブロックモデルのロバスト学習における、新たな情報理論的限界を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。