Skip to main content
QUICK REVIEW

[論文レビュー] Robust Estimation under Heavy Contamination using Enlarged Models

Takafumi Kanamori, Hironori Fujisawa|arXiv (Cornell University)|Nov 21, 2013
Advanced Statistical Methods and Models参考文献 16被引用数 5
ひとこと要約

本稿では、重い尾を持つデータや外れ値で汚染されたデータにおいて、モデルのパラメータと汚染率を同時に推定するためのロバスト推定フレームワークを提示する。統計モデルに汚染率を組み込むことで、外れ値検出が可能となり、不均一な汚染下でも低いバイアスを維持する。数値実験では、従来の推定器を上回る性能を示した。

ABSTRACT

In data analysis, contamination caused by outliers is inevitable, and robust statistical methods are strongly demanded. In this paper, our concern is to develop a new approach for robust data analysis based on scoring rules. The scoring rule is a discrepancy measure to assess the quality of probabilistic forecasts. We propose a simple way of estimating not only the parameter in the statistical model but also the contamination ratio of outliers. Estimating the contamination ratio is important, since one can detect outliers out of the training samples based on the estimated contamination ratio. For this purpose, we use scoring rules with an extended statistical models, that is called the enlarged models. Also, the regression problems are considered. We study a complex heterogeneous contamination, in which the contamination ratio of outliers in the dependent variable may depend on the independent variable. We propose a simple method to obtain a robust regression estimator under heterogeneous contamination. In addition, we show that our method provides also an estimator of the expected contamination ratio that is available to detect the outliers out of training samples. Numerical experiments demonstrate the effectiveness of our methods compared to the conventional estimators.

研究の動機と目的

  • 測定誤差や記録誤差による外れ値を含むデータにおけるロバスト統計的推論の課題に対処すること。
  • モデルのパラメータと汚染率の両方を同時に推定する統一的な手法を開発すること。
  • 推定された汚染率に基づき、推定密度値が低いサンプルを特定することで、外れ値検出を可能にすること。
  • 共変数に応じて汚染率が変化する(不均一な汚染)ような複雑な汚染状況を扱えること。
  • スコアリングルールと拡大モデルを用いた、理論的裏付けが強く、漸近的に有効なロバスト推定フレームワークを提供すること。

提案手法

  • 確率密度関数に限らない非負関数上で定義されたスコアリングルールを用いて、ロバスト推定量を構築する。
  • 元の統計モデルと汚染成分を含む拡大モデルを導入し、パラメータと汚染率の同時推定を可能にする。
  • ホルダー・スコア(スコアリングルールの一種)を用いて、重い汚染に対してロバストな推定量を導出する。
  • モデルの重み付き適合と汚染成分のバランスを取る推定方程式を解くことで、汚染率を推定する。
  • 漸近的理論を用いて推定量の極限分布を導出し、複雑な汚染下でも一貫性と低いバイアスを示すことを示す。
  • 回帰の文脈では、共変数に応じて外れ値率が変化する不均等分散汚染(heteroscedastic contamination)に対応するように拡張する。

実験結果

リサーチクエスチョン

  • RQ1重い汚染下において、1つの推定フレームワークがモデルのパラメータと汚染率を同時に推定可能か?
  • RQ2学習データから推定された汚染率を用いて、外れ値検出を体系的に行えるか?
  • RQ3共変数に応じて汚染率が変化する不均一な汚染下で、提案手法の推定量の漸近的挙動はいかなるものか?
  • RQ4入力変数と出力変数の両方が汚染されている場合でも、バイアスが小さくかつ効率的であるか?
  • RQ5推定精度と外れ値検出性能の観点から、従来のロバスト推定器と比較して、本手法はどのように優れているか?

主な発見

  • 提案手法の推定量は、共変数に応じて汚染率が変化する不均一な汚染下でも、漸近的一貫性と低いバイアスを達成する。
  • 本手法は汚染率を適切に推定でき、推定密度値の順位付けによって外れ値を体系的に同定可能である。
  • 数値実験により、重い汚染下でも推定精度とロバスト性の面で、従来の推定器を上回ることが示された。
  • 推定量の漸近的分散・共分散行列は良好に振る舞い、明確な極限値に収束する。バイアス項は $O(\bar{\varepsilon}^{1/2})$ のオーダーである。
  • 独立変数と従属変数の両方が重度に汚染されている場合でも、良好な性能を維持し、強い実用的ロバスト性を示す。
  • 本手法は、スコアリングルールを用いた1つの最適化手続き内で、パラメータ推定と外れ値検出を統合する包括的なフレームワークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。