Skip to main content
QUICK REVIEW

[論文レビュー] Learning Discrete Distributions from Untrusted Batches

Mingda Qiao, Gregory Valiant|arXiv (Cornell University)|Nov 22, 2017
Machine Learning and Algorithms参考文献 27被引用数 9
ひとこと要約

本稿では、最大 $\epsilon$ 分の 1 のバッチが敵対的に入力されたデータバッチから離散的確率分布を学習するためのロバストなアルゴリズムを提案する。2つの手法を導入する。1つ目は、サポートサイズ $n$ に関して指数的時間だが、$k$、$1/\epsilon$、$1/\eta$ に関して多項式時間であり、誤差 $O(\eta + \epsilon/\sqrt{k})$ を達成する。この手法は $O((n+k)/\epsilon^2)$ バッチを必要とする。2つ目は、$\eta=0$ の場合に限り、$\operatorname{poly}((nk)^k)$ 時間で動作し、新しい $\ell_1$-ベースのテンソル近似を用いて、同じ誤差境界を達成する。

ABSTRACT

We consider the problem of learning a discrete distribution in the presence of an $ε$ fraction of malicious data sources. Specifically, we consider the setting where there is some underlying distribution, $p$, and each data source provides a batch of $\ge k$ samples, with the guarantee that at least a $(1-ε)$ fraction of the sources draw their samples from a distribution with total variation distance at most $η$ from $p$. We make no assumptions on the data provided by the remaining $ε$ fraction of sources--this data can even be chosen as an adversarial function of the $(1-ε)$ fraction of "good" batches. We provide two algorithms: one with runtime exponential in the support size, $n$, but polynomial in $k$, $1/ε$ and $1/η$ that takes $O((n+k)/ε^2)$ batches and recovers $p$ to error $O(η+ε/\sqrt{k})$. This recovery accuracy is information theoretically optimal, to constant factors, even given an infinite number of data sources. Our second algorithm applies to the $η= 0$ setting and also achieves an $O(ε/\sqrt{k})$ recover guarantee, though it runs in $\mathrm{poly}((nk)^k)$ time. This second algorithm, which approximates a certain tensor via a rank-1 tensor minimizing $\ell_1$ distance, is surprising in light of the hardness of many low-rank tensor approximation problems, and may be of independent interest.

研究の動機と目的

  • データバッチの一部が敵対的ソースによって任意に汚染される状況下で、離散的確率分布を学習する問題に対処すること。
  • 汚染されたデータが良いデータに敵対的に依存しても正確に保たれるようなアルゴリズムを設計すること。
  • 信頼できないデータバッチの存在下で、情報理論的に最適な誤差境界を達成すること。
  • $\eta = 0$ の特別な場合、すなわち良いバッチがターゲット分布 $p$ にi.i.d.に従う場合のための効率的アルゴリズムを開発すること。
  • 汚染されたデータに対する最小限の仮定の下で、サンプル必要数と誤差境界に関する理論的保証を提供すること。

提案手法

  • 最初のアルゴリズムは、バッチの周図度テンソルを用い、観測されたバッチ周図度と $\ell_1$ 距離で近い分布の集合 $\textsf{DistSet}(n,k,A)$ の中で候補を探索する。
  • 関数 $f_{n,t}(\epsilon,m)$ を用いた再帰的集中不等式を適用し、真の分布 $p$ と $\textsf{DistSet}$ 内の最良候補との距離を上界で抑え込む。
  • 2番目のアルゴリズムは、分布 $p$ の $k$ 重テンソル積を、$\ell_1$ 距離を最小化するランク1テンソルで近似する。一般に低ランクテンソル近似は困難であるが、本設定では驚くべきほど扱いやすい性質を示す。
  • 全変動距離のテンソル化性質を利用している:$\|p^{\
  • research_questions
  • key_findings

実験結果

リサーチクエスチョン

  • RQ1データバッチの $\epsilon$ 分の 1 が敵対的に汚染されている場合、無限のデータが与えられても、分布学習の根本的限界は何か?
  • RQ2信頼できないバッチの下で、$O(\eta + \epsilon/\sqrt{k})$ の誤差を達成可能であり、これが最適であるか?
  • RQ3一般に低ランクテンソル近似が困難であるにもかかわらず、$\eta = 0$ の場合に $O(\epsilon/\sqrt{k})$ の誤差を達成する効率的アルゴリズムを設計可能か?
  • RQ4敵対的汚染が存在する中で、与えられた誤差許容範囲を高い確率で達成するために必要なバッチ数はどれくらいか?
  • RQ5敵対的データが良いデータを観測し、それに反応する場合でも、ロバストな推定器を構築可能か?

主な発見

  • 提案されたアルゴリズムは、$O((n+k)/\epsilon^2)$ バッチを用いて、$O(\eta + \epsilon/\sqrt{k})$ の誤差境界を達成する。これは定数要因を除いて情報理論的に最適である。
  • 誤差境界 $O(\eta + \epsilon/\sqrt{k})$ は、無限データの極限でもタイトである。下界 $2\eta + \epsilon/\sqrt{2k}$ が一致することを示している。
  • $\eta = 0$ の場合、2番目のアルゴリズムは $\operatorname{poly}((nk)^k)$ 時間で $O(\epsilon/\sqrt{k})$ の誤差を達成するが、一般に低ランクテンソル近似は計算的に困難である。
  • 本手法は、$p^{\otimes k}$ の新しい $\ell_1$-ベースのランク1近似を活用しており、この設定では驚くべきほど扱いやすい。
  • サンプル必要数は $O((n+k)/\epsilon^2)$ であり、アルゴリズムは $1 - \delta$ の高確率で成功する。$n$、$k$、$\epsilon$、$\delta$ に対する明示的な依存関係が得られている。
  • 解析により、良いデータに依存する敵対的汚染でさえも、この手法が誤差を最適に保ち、最悪の汚染に対して強い耐性を示すことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。