Skip to main content
QUICK REVIEW

[論文レビュー] The Limits of Post-Selection Generalization

Kobbi Nissim, Adam Smith|arXiv (Cornell University)|Jun 15, 2018
Privacy-Preserving Technologies in Data参考文献 23被引用数 10
ひとこと要約

この論文は、適応的データ解析における統計的妥当性を保証するための主要なメカニズムである後方一般化に関する根本的な制限を確立する。後方一般化を満たすアルゴリズムの誤差に対するタイトな下界を証明し、この性質が合成に関しては閉じていないことを示しているが、既存のアルゴリズムでは強い実効的合成特性を示している。

ABSTRACT

While statistics and machine learning offers numerous methods for ensuring generalization, these methods often fail in the presence of adaptivity---the common practice in which the choice of analysis depends on previous interactions with the same dataset. A recent line of work has introduced powerful, general purpose algorithms that ensure post hoc generalization (also called robust or post-selection generalization), which says that, given the output of the algorithm, it is hard to find any statistic for which the data differs significantly from the population it came from. In this work we show several limitations on the power of algorithms satisfying post hoc generalization. First, we show a tight lower bound on the error of any algorithm that satisfies post hoc generalization and answers adaptively chosen statistical queries, showing a strong barrier to progress in post selection data analysis. Second, we show that post hoc generalization is not closed under composition, despite many examples of such algorithms exhibiting strong composition properties.

研究の動機と目的

  • 適応的データ解析後のロバストな統計的推論のフレームワークを保証するアルゴリズムにおける固有の制限を特定すること。
  • 適応的に選択された統計的問い合わせに応答する際、後方一般化を満たす任意のアルゴリズムの誤差に対するタイトな下界を確立すること。
  • 既存のアルゴリズムで強く観察される実効的合成特性にもかかわらず、後方一般化が合成に関して閉じているかどうかを調査すること。
  • これらの制限により、既存の汎用的後選択推論アルゴリズムが根本的な理論的障壁に直面していることを示すこと。

提案手法

  • 後方一般化を、アルゴリズムの出力から得られる統計量のうち、データ上の経験的平均がその母集団平均と著しく異なるものが存在しないという保証として形式化する。
  • 任意の後方一般化アルゴリズムの誤差に対する下界を証明するために、擬似乱数生成子(PRG)の安全性への還元を用いる。
  • 後方一般化アルゴリズムが誤差バウンドを満たさない場合、PRGを破壊する区別器を構築し、Hoeffdingの不等式と統計的距離の境界を活用する。
  • 計算的に強固な一般化を実現するアルゴリズムを構築するために、置換ベースのPRG構成(PRG-Encrypermute)を用いる。
  • PRG構成における実際の分布と一様分布の間の統計的距離を分析し、問い合わせ推定値の乖離を制限する。
  • ハイブリッド法とカップリング技術を用いて、実際の入力と一様入力の下でのアルゴリズムの挙動を比較し、乖離確率がほぼ同一であることを示す。

実験結果

リサーチクエスチョン

  • RQ1適応的に選択された統計的問い合わせに応答する際、後方一般化を満たす任意のアルゴリズムの誤差に対する、最もタイトな可能な下界は何か?
  • RQ2後方一般化は合成に関して閉じているか。つまり、2つの後方一般化アルゴリズムの合成が、一般化保証を保持するか?
  • RQ3後方一般化アルゴリズムの誤差は、標本サイズと信頼パラメータの非自明な関数によって下から抑えられるか?
  • RQ4実際には強い合成特性を示す既知のアルゴリズムが、理論的には正式に合成可能であるとは限らない程度はどれほどか?
  • RQ5擬似乱数生成子の安全性を用いて、適応的データ解析における一般化の根本的限界を確立できるか?

主な発見

  • この論文は、後方一般化を満たす任意のアルゴリズムの誤差に対するタイトな下界を確立する:任意のδ ≥ n⁻¹⁰⁰およびε = √(8 ln(16/δ)/n)に対して、そのようなアルゴリズムは誤差をε未満に保証できる確率がδを上回ることは不可能である。
  • 後方一般化が合成に関して閉じていないことを証明する。つまり、2つのアルゴリズムが個別に後方一般化を満たしていても、それらの合成が一般化保証を保持するとは限らない。
  • 下界はタイトであり、既知のアルゴリズム(例:PRG-Encrypermute)の誤差率と一致しており、最悪ケースでは改善が不可能であることを示している。
  • アルゴリズムの出力とデータサンプルに基づく区別器の構築により、アルゴリズムが誤差バウンドを満たさない場合に矛盾が生じる。これにより、PRGの安全性を用いて下界を証明する。
  • PRG構成における実際の分布と一様分布の間の統計的距離はk⁻ᵏ/⁸以下に抑えられる。これにより、アルゴリズムの出力が一様分布から計算的に区別不能となり、一般化保証が可能になる。
  • PRGが一様文字列に置き換えられた場合、問い合わせ推定値の大きな乖離確率が依然として有界であることが示され、アルゴリズムが提示された誤差パrameterで後方一般化を満たしていることが証明される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。