Skip to main content
QUICK REVIEW

[論文レビュー] A Polynomial Time Algorithm for Lossy Population Recovery

Ankur Moitra, Michael Saks|arXiv (Cornell University)|Feb 6, 2013
Machine Learning and Algorithms参考文献 20被引用数 7
ひとこと要約

この論文は、各ビットが確率 $1 - \mu$ でi.i.d.に欠落する状況下での損失あり集団回復問題に対して、多項式時間アルゴリズムを提示する。線形計画法の双対性と複素解析を活用することで、指数的に小さい条件数を持つ重要な行列に対し、ロバストな局所的逆行列の存在を証明し、任意の固定された $\mu > 0$ に対して、$n$ ビット文字列上での未知の分布を $\varepsilon$-精度で、$n$ および $1/\varepsilon$ の多項式時間で効率的に学習可能である。この結果により、Dvir らが提唱した制限アクセスモデルにおける DNF の学習に対する最初の多項式時間アルゴリズムが得られる。

ABSTRACT

We give a polynomial time algorithm for the lossy population recovery problem. In this problem, the goal is to approximately learn an unknown distribution on binary strings of length $n$ from lossy samples: for some parameter $μ$ each coordinate of the sample is preserved with probability $μ$ and otherwise is replaced by a `?'. The running time and number of samples needed for our algorithm is polynomial in $n$ and $1/\varepsilon$ for each fixed $μ>0$. This improves on algorithm of Wigderson and Yehudayoff that runs in quasi-polynomial time for any $μ> 0$ and the polynomial time algorithm of Dvir et al which was shown to work for $μ\gtrapprox 0.30$ by Batman et al. In fact, our algorithm also works in the more general framework of Batman et al. in which there is no a priori bound on the size of the support of the distribution. The algorithm we analyze is implicit in previous work; our main contribution is to analyze the algorithm by showing (via linear programming duality and connections to complex analysis) that a certain matrix associated with the problem has a robust local inverse even though its condition number is exponentially small. A corollary of our result is the first polynomial time algorithm for learning DNFs in the restriction access model of Dvir et al.

研究の動機と目的

  • 各ビットが確率 $1 - \mu$ で独立に欠落する状況下で、任意の固定された $\mu > 0$ に対して損失あり集団回復を多項式時間で解くこと。
  • 従来の準多項式時間手法が直面するサポートサイズ $k$ に依存する指数的依存を克服すること。
  • 複素解析の道具を用いて、指数的に小さい条件数を持つ行列に対し、ロバストな局所的逆行列の存在を確立すること。
  • 未知の分布のサポートサイズに事前限界がない一般ケースへのアルゴリズムの拡張。
  • Dvir らが提唱した制限アクセスモデルにおける DNF 学習に対する最初の多項式時間解法を提供すること。

提案手法

  • アルゴリズムは、各ビットが確率 $1 - \mu$ で '?' に置き換えられる損失ありサンプルから、未知の分布を線形計画法で推定する。
  • 主な技術的貢献は、サンプリングプロセスに関連するある行列が、その条件数が指数的に小さいにもかかわらず、ロバストな局所的逆行列を持つことを証明することにある。
  • 証明は、特にハダマールの三円定理とモービウス変換を用いて、複素単位円板上での正則関数の挙動を分析する複素解析に基づく。
  • 重要な不確定性原理が確立される:正則関数が中心 $\beta$ の円板 $D_\rho(\beta)$ 上で有界であれば、その原点における値が原点から離れた円周上での最大値を制御でき、定量的な下界が得られる。
  • プライマル(分布推定)とデュアル(多項式緩和)プログラムの双対性を用い、デュアル目的関数が逆行列の条件数の関数として有界であることを示す。
  • ランタイムにおける $k$ 依存性を避けることで、分布のサポートサイズが無限大であっても、一般化可能である。

実験結果

リサーチクエスチョン

  • RQ1任意の固定された $\mu > 0$ に対して、$\mu$ が 0 から離れている必要がない状況下で、損失あり集団回復を多項式時間で解けるか?
  • RQ2条件数が指数的に小さい場合であっても、サンプリング行列に対してロバストな局所的逆行列が存在するか?
  • RQ3エラー付きチャネルに用いられた技術を、ビットが消去されるのではなく反転するより一般的なノイズあり集団回復モデルへ拡張可能か?
  • RQ4制限アクセスモデルにおける DNF の学習を多項式時間で達成可能か?(これは損失あり集団回復に還元可能である。)
  • RQ5複素解析は、データ損失下での統計的推定に現れる行列の可逆性を証明するために果たす役割は何か?

主な発見

  • アルゴリズムの実行時間は $O((n/\varepsilon)^{2f(\mu)})$ であり、$f(\mu) = \frac{1}{\mu \log(2/\mu)} + O(1)$ である。$\mu > 0$ が固定されている限り、$n$ および $1/\varepsilon$ の多項式時間で実行可能である。
  • ロバストな局所的逆行列の存在は、複素解析的不確定性原理を用いて証明され、正則関数が中心 $1 - \mu$ の円板で有界であれば、原点で大きな値を取っているならば、単位円周上でも大きな値を取らざるを得ないことを示している。
  • 従来の準多項式時間アルゴリズムが $k$ 依存性を有するのとは異なり、分布のサポートサイズが無限大であっても本手法は有効である。
  • アルゴリズムは、すべての文字列に対して誤差が $\varepsilon$ 以下であり、サポート内の文字列については真の確率から $\varepsilon$ 以内の推定値を得る。
  • この結果により、Dvir らが提唱した制限アクセスモデルにおける DNF 学習に対する最初の多項式時間アルゴリズムが得られる。このモデルでは、各例は入力変数のランダムな制限である。
  • 解析により、複素単位円板 $D_1$ 上での $L^\infty$-ノルムを用いたデュアル緩和が、プライマル目的関数に対してタイトな境界を与えることが示され、多項式実行時間の実現が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。