Skip to main content
QUICK REVIEW

[論文レビュー] Learning Entangled Single-Sample Distributions via Iterative Trimming

Hui Yuan, Yingyu Liang|arXiv (Cornell University)|Apr 20, 2020
Machine Learning and Algorithms被引用数 4
ひとこと要約

本稿では、共通パラメータを共有する複数の異なる分布に由来する $ n $ 個の独立な標本からなる、絡み合った単一標本分布における共通パラメータ推定のための反復的トリミング手法を提案する。この手法は対数的反復回数でノイズの強い点をトリミングし、推定誤差が $ \lceil \alpha n \rceil $-番目にノイジーな点のノイズレベルにのみ依存するようになる。これにより、一般の条件下でノイズの強いデータの定数割合(最大1/5まで)に対してロバスト性を示す。

ABSTRACT

In the setting of entangled single-sample distributions, the goal is to estimate some common parameter shared by a family of distributions, given one \emph{single} sample from each distribution. We study mean estimation and linear regression under general conditions, and analyze a simple and computationally efficient method based on iteratively trimming samples and re-estimating the parameter on the trimmed sample set. We show that the method in logarithmic iterations outputs an estimation whose error only depends on the noise level of the $\lceil αn ceil$-th noisiest data point where $α$ is a constant and $n$ is the sample size. This means it can tolerate a constant fraction of high-noise points. These are the first such results for the method under our general conditions. It also justifies the wide application and empirical success of iterative trimming in practice. Our theoretical results are complemented by experiments on synthetic data.

研究の動機と目的

  • 共通パラメータを共有する異なる分布に由来する各標本が存在する、絡み合った単一標本分布設定におけるパラメータ推定を扱う。
  • 定数割合の標本が高ノイズである場合でもロバストな、計算効率の良い推定量を開発する。
  • ノイズが多くて不均一なデータ設定における反復的トリミングの広範な経験的成功を理論的に裏付ける。
  • 対称的または単峰型分布にとどまらず、より一般的な条件、特に多変量平均推定および線形回帰への応用を含む。

提案手法

  • 現在の残差に基づいて、最も外れ値に近い標本の一部を反復的にトリミングすることで推定量を改善する。
  • 各反復で、残りのノイズが小さい標本のみを使って新たな推定量を計算する。
  • トリミングの閾値は、平均推定では共分散行列のノルムの $ \lceil \alpha n \rceil $-番目に大きいもの、回帰では残差の大きさに基づく。
  • 反復回数は $ O(\log n) $ 回であり、計算効率が保証される。
  • 線形回帰の場合、識別可能性を保証するために設計行列が十分に散らばっていると仮定する。
  • 従来のトリムド推定量の効率的で、交互更新型の変種とみなされ、部分集合に対する指数的探索を回避する。

実験結果

リサーチクエスチョン

  • RQ1絡み合った単一標本分布において、反復的トリミングは $ \lceil \alpha n \rceil $-番目にノイジーな点のノイズレベルにのみ依存する推定誤差を達成できるか?
  • RQ2一般の分布的仮定のもとでも、定数割合の標本が高ノイズであっても、反復的トリミング手法はロバスト性を維持できるか?
  • RQ3多変量平均推定および線形回帰において、この手法は計算的に効率的かつ理論的に正当化可能か?
  • RQ4反復的トリミングの性能は、すべての標本の真のノイズレベルを知っているオラクル推定量と比べてどうか?

主な発見

  • 多変量平均推定において、反復的トリミング手法は $ \lceil \alpha n \rceil $-番目に大きな共分散行列ノルムのノイズレベルにのみ依存する誤差バウンドを達成し、$ \alpha \geq 4/5 $ のとき、最大1/5の高ノイズ点に対してロバストであることを示す。
  • 一変量および多変量正規分布設定において、反復的トリミング手法は、$ \alpha n $ 個のノイズが最も小さい標本のみを使うオラクル平均推定量と同等の推定誤差を達成する。
  • 線形回帰において、設計行列に正則性条件が満たされれば、反復的トリミング手法は $ \alpha n $ 個のノイズ分散が最小の標本のみを使うオラクル最小二乗推定量に近い誤差を達成する。
  • この手法は $ O(\log n) $ 反復で収束し、正確なトリムド推定量と比較して計算的に効率的である。
  • 合成データ上の実験により、反復的トリミングはオラクル推定量と同等の性能を示し、理論的誤差バウンドの妥当性を裏付ける。
  • 先行研究で仮定されていた極端な対称性仮定は必ずしも必要ではなく、非対称な共分散構造に対しても本手法は良好に機能することが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。