Skip to main content
QUICK REVIEW

[論文レビュー] Learning-based Support Estimation in Sublinear Time

Talya Eden, Piotr Indyk|arXiv (Cornell University)|Jun 15, 2021
Machine Learning and Algorithms参考文献 26被引用数 8
ひとこと要約

本稿では、要素の頻度を推定する機械学習予測器を活用することで、サブラインアー時間のサポートサイズ推定を学習ベースのアプローチで提案する。予測器が真の頻度の定数倍以内であれば、サンプル複雑度が $\log(1/\varepsilon) \cdot n^{1 - \Theta(1/\log(1/\varepsilon))}$ に低下し、従来の $O(n / \log n)$ の境界を著しく上回り、実世界のデータセットにおける実験で最大3倍の精度向上を達成する。

ABSTRACT

We consider the problem of estimating the number of distinct elements in a large data set (or, equivalently, the support size of the distribution induced by the data set) from a random sample of its elements. The problem occurs in many applications, including biology, genomics, computer systems and linguistics. A line of research spanning the last decade resulted in algorithms that estimate the support up to $ \pm \varepsilon n$ from a sample of size $O(\log^2(1/\varepsilon) \cdot n/\log n)$, where $n$ is the data set size. Unfortunately, this bound is known to be tight, limiting further improvements to the complexity of this problem. In this paper we consider estimation algorithms augmented with a machine-learning-based predictor that, given any element, returns an estimation of its frequency. We show that if the predictor is correct up to a constant approximation factor, then the sample complexity can be reduced significantly, to \[ \ \log (1/\varepsilon) \cdot n^{1-Θ(1/\log(1/\varepsilon))}. \] We evaluate the proposed algorithms on a collection of data sets, using the neural-network based estimators from {Hsu et al, ICLR'19} as predictors. Our experiments demonstrate substantial (up to 3x) improvements in the estimation accuracy compared to the state of the art algorithm.

研究の動機と目的

  • 大規模データセットにおける異なる要素の数をサブラインアーなサンプリングで推定するという根本的な問題に取り組む。
  • 従来の方法の既知の $O(n / \log n)$ の下界を超えて、サポートサイズ推定のサンプル複雑度を低減する。
  • 要素の頻度を予測する機械学習予測器が、より効率的な推定を可能にするかを調査する。
  • 予測器の信頼性と統計的推定手法を統合する新しいアルゴリズムを設計・評価する。
  • 訓練されたニューラルネットワーク予測器を用いて実世界のデータセットでこの手法を実証的に検証し、向上した精度と頑健性を示す。

提案手法

  • 確率の範囲を幾何的に増加する間隔に分割することで、細かい推定を可能にする。
  • サンプルされた要素を、推定頻度に基づいて予測器 $\Pi(i)$ を用いて各間隔に割り当てる。
  • 各間隔内で、区間固有のパラメータを用いたチェビシェフ多項式を用いた修正版のウー=ヤン推定器を適用する。
  • 信頼性の低い間隔推定をフィルタリングするための健全性チェックを組み込み、頑健性を向上させる。
  • 精度と安定性のバランスを取るために、動的に間隔の基数を選択し、劣悪な予測に過剰適合を避ける。
  • 理論的分析により、定数倍以内に正確な予測器が使用可能な場合、サンプル複雑度が $\log(1/\varepsilon) \cdot n^{1 - \Theta(1/\log(1/\varepsilon))}$ に低下することが示された。

実験結果

リサーチクエスチョン

  • RQ1要素の頻度を推定する機械学習予測器が、サポートサイズ推定のサンプル複雑度を改善できるか?
  • RQ2予測器が真の頻度の定数倍以内にある場合、理論的サンプル複雑度にどの程度の向上が得られるか?
  • RQ3予測器が時間経過とともに陳腐化したり、精度が低下しても、このアルゴリズムはどの程度精度を保てるか?
  • RQ4実際の応用において、この手法は最先端のウー=ヤン推定器をどの程度上回るか?
  • RQ5アルゴリズムは予測器の品質にどの程度敏感であり、不完全な予測に対しても頑健性を保つためのメカニズムは何か?

主な発見

  • 予測器が真の頻度の定数倍以内にある場合、提案手法はサンプル複雑度を $\log(1/\varepsilon) \cdot n^{1 - \Theta(1/\log(1/\varepsilon))}$ に低下させ、$O(n / \log n)$ の境界を上回る。
  • AOLデータセットでは、$n$ の5%および10%のサンプルサイズにおいて、それぞれ中央値で2.2倍から3.0倍の精度向上を達成した。
  • IPデータセットでは、$n$ の1%および2.5%のサンプルサイズにおいて、それぞれ中央値で1.7倍から3.0倍の精度向上を達成した。
  • アルゴリズムは時間経過に対しても頑健であり、AOLおよびIPデータセットの複数日の複数分にわたって、予測器が陳腐化しても一貫した性能を維持した。
  • 健全性チェック機構は、予測器が不正確な場合に信頼性の低い間隔推定を効果的にフィルタリングし、性能の低下を防いでいた。
  • 予測器の品質が劣化するにつれて、アルゴリズムの性能はウー=ヤン推定器の性能に収束し、劣化を緩やかに保証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。