Skip to main content
QUICK REVIEW

[論文レビュー] MONK -- Outlier-Robust Mean Embedding Estimation by Median-of-Means

Matthieu Lerasle, Zoltán Szabó|arXiv (Cornell University)|Feb 13, 2018
Statistical Methods and Inference参考文献 79被引用数 13
ひとこと要約

本稿では、中央値の平均の原理を用いて、カーネル平均埋め込みおよび最大平均差分(MMD)のための、外れ値に強い新しい推定器であるMONKを提案する。データをブロックに分割し、ブロック単位の経験的平均を計算した後、それらの中央値をとることで、サブガウス型の分散バウンドを達成し、無限大のカーネルに対しても強い外れ値耐性を示す。また、やや厳しい仮定のもとで最適な統計的レートを維持する。

ABSTRACT

Mean embeddings provide an extremely flexible and powerful tool in machine learning and statistics to represent probability distributions and define a semi-metric (MMD, maximum mean discrepancy; also called N-distance or energy distance), with numerous successful applications. The representation is constructed as the expectation of the feature map defined by a kernel. As a mean, its classical empirical estimator, however, can be arbitrary severely affected even by a single outlier in case of unbounded features. To the best of our knowledge, unfortunately even the consistency of the existing few techniques trying to alleviate this serious sensitivity bottleneck is unknown. In this paper, we show how the recently emerged principle of median-of-means can be used to design estimators for kernel mean embedding and MMD with excessive resistance properties to outliers, and optimal sub-Gaussian deviation bounds under mild assumptions.

研究の動機と目的

  • 特に無限大のカーネルおよび外れ値の汚染下で、古典的な経験的平均推定器の外れ値に対する耐性の欠如という深刻な問題を解決すること。
  • U統計量やV統計量といった標準的な推定器が、たった一つの外れ値に対しても極端に敏感であるため、結果が著しく歪められることを克服すること。
  • やや厳しいモーメント条件のもとで、最適な統計的レート(例:$N^{-1/2}$)を維持する理論的根拠に基づいた外れ値耐性を持つ推定器を設計すること。
  • 重い尾を持つまたは汚染されたデータが存在する状況下で、初めて外れ値に強いMMD推定器の一致性とサブガウス型の分散バウンドを確立すること。
  • ガウス分布、パレート分布、および実世界のDNA配列データを用いた実験を通じて、MONKの実用的適用性を示し、外れ値に敏感な状況下での優位性を示すこと。

提案手法

  • 入力データを$Q$個の互いに素なブロックに分割し、カーネル平均埋め込みのブロック単位の経験的平均推定値を形成する。
  • 中央値の平均の原理を適用し、$Q$個のブロック単位の推定値の中央値を計算することで、極端な値への感受性を低減する。
  • 平均埋め込み$\mu_{\mathbb{P}}$およびMMD$\|\mu_{\mathbb{P}} - \mu_{\mathbb{Q}}\|_{\mathscr{H}_K}$の両方に対して、中央値の平均推定器を適用し、耐性を確保する。
  • モーメント条件のもとで、カーネルが無限大であってもサブガウス型の分散バウンドを理論的に確立する。
  • 2つの変種を提案する:MONK BCD(ブロック単位の計算)およびMONK BCD-Fast(大規模または計算コストの高いカーネル計算に最適化)。
  • ブートストラップに基づく分位数推定を用いて、2標本検定にMONK推定器を統合し、汚染下でも耐性のある仮説検定を可能にする。

実験結果

リサーチクエスチョン

  • RQ1中央値の平均の原理を、カーネル平均埋め込みおよびMMD推定に効果的に適用することで、外れ値に対して耐性を持つことができるか?
  • RQ2やや厳しいモーメント仮定のもとで、このような外れ値に強い推定器に対して、具体的にサブガウス型の分散バウンドを確立できるか?
  • RQ3外れ値が存在する状況下で、中央値の平均に基づくMONK推定器は、古典的なU統計量およびV統計量推定器と比べてどのように性能を発揮するか?
  • RQ4重い尾を持つまたは汚染されたデータに対しても、MONKは最適な統計的レート(例:$N^{-1/2}$)を維持できるか?
  • RQ5生物学的配列解析のような、計算コストの高いカーネル計算を伴う実世界の応用において、MONKはスケーラブルで実用的か?

主な発見

  • カーネルが無限大であっても、やや厳しいモーメント条件のもとで、MONKは平均埋め込みおよびMMD推定の両方においてサブガウス型の分散バウンドを達成する。
  • ガウス分布およびパレート分布を用いた実験において、特に2次およびRBFカーネル下で、外れ値汚染下においてU統計量ベースの推定器よりもMONKが顕著に優れている。
  • DNAスプライスジャンクションデータセットでは、3つの推定器(MONK BCD、MONK BCD-Fast、U-Stat)ともEIおよびIEサイトを正しく識別したが、$N=766$、$Q=15$の条件下で、MONK BCD-FastはU-Stat(32秒対1分28秒)に比べて最大2.5倍速かった。
  • MONK BCD-Fastは優れた計算効率を示し、ストリングサブシーケンスカーネルのような大規模または計算コストの高いカーネル応用に適している。
  • 中央値の平均アプローチにより、1つの外れ値がデータを汚染しても一貫性と耐性が保証される。これに対して、古典的推定器は結果が任意に歪められる可能性がある。
  • クラス間およびクラス内テストの両方において、MONKに基づくMMD推定値は、正しい意思決定境界に安定して収束し、クラス間では$\widehat{\operatorname{MMD}} - \hat{q}_{1-\alpha} > 0$、クラス内では$< 0$となることが確認され、有効な仮説検定が実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。