Skip to main content
QUICK REVIEW

[論文レビュー] LAD Regression and Nonparametric Methods for Detecting Outliers and Leverage Points

Giuseppe Melfi, Susana Faria|arXiv (Cornell University)|Jul 25, 2005
Advanced Statistical Methods and Models参考文献 6被引用数 4
ひとこと要約

本稿では、LAD(最小絶対偏差)回帰における外れ値およびレバレッジ点を検出する非パrametricでロバストな手法を提案する。この手法は、1つずつ除外したサブセットに対して繰り返しLADフィッティングを行い、Lスコア(点がLADフィットに含まれる頻度)とOスコア(各サブセットで最大の偏差を持つ点の頻度)を計算することで、レバレッジ点(高いLスコア)と外れ値(高いOスコア)を特定する。古典的手法やHadiベースの手法よりも、高レバレッジ状況におけるマスキング外れ値の検出において優れた性能を示す。

ABSTRACT

The detection of influential observations for the standard least squares regression model is a question that has been extensively studied. LAD regression diagnostics offers alternative approaches whose main feature is the robustness. In this paper a new approach for nonparametric detection of influencial observations in LAD regression models is presented and compared with other classical methods of diagnostics.

研究の動機と目的

  • 古典的手法の限界を克服する、LAD回帰における影響力のある観測値を検出するロバストで非パrametricな手法の開発を目的とする。
  • 標準的手法では外れ値の特定が遮蔽される「マスキング効果」を解消する。
  • 一貫性があり、計算的に実行可能であるが、自然なロバスト性要件を満たす、繰り返しLADフィッティングに基づく原理的で整合性のあるアプローチを提供する。
  • 実データおよびシミュレートされたデータセットを用いて、提案手法を古典的手法およびHadiベースの診断法と比較し、外れ値およびレバレッジ点の両方の検出性能を評価する。

提案手法

  • 各観測値に対して、全n-1個のサブセットに対してLAD回帰をフィットし、観測値がフィットした超平面に含まれる場合に1点、そうでない場合に0点を割り当て、すべてのサブセットで合計してLスコアを計算する。
  • Oスコアも同様に計算されるが、各leave-one-outサブセットで絶対偏差が最大となる観測値に1点を割り当て、すべてのサブセットで合計する。
  • Lスコアが高く(例:期待値p+1より顕著に高い)、Oスコアが高く(例:期待値1より顕著に高い)な観測値が、それぞれレバレッジ点および外れ値として特定される。
  • 一意なLAD解と非線形相関のない点の仮定により、安定的かつ解釈可能なスコアを保証する。
  • Splusコードを用いて実装され、実データセット(Telephone, Hawkins, Scottish)およびシミュレートされたデータセット(twovariables, threevariables)に適用された。
  • スコアは確率的モデルに基づいて解釈される:E[L(k)] = p+1 および E[O(k)] = 1 であり、極端な値を特定するための基準となる。

実験結果

リサーチクエスチョン

  • RQ1マスキングが生じる状況下でも、古典的手法よりも効果的に外れ値およびレバレッジ点を検出できる非パrametricでLADベースの手法が存在するか?
  • RQ2LスコアとOスコアは、既知の影響力のある観測値を有する多様なデータセットにおいて、高レバレッジ点および外れ値をどの程度正しく特定できるか?
  • RQ3繰り返しleave-one-out LADフィッティングアプローチは、汚染に対してロバスト性を示し、古典的手法が失敗する状況でも検出性能を向上させるか?
  • RQ4Hadiの手法と比較して、Hawkinsのような病理的データセットにおける外れ値とレバレッジ点の組み合わせ検出において、提案手法はどの程度優れているか?
  • RQ5高レバレッジ点が存在する状況下でも、外れ値に対する感度をどの程度保持できるか?

主な発見

  • 「Telephone」データセットでは、4つの外れ値(ケース17–20)をすべて正しく検出。古典的手法およびHadiベースの手法は、ケース19および20をマスキングにより見逃していた。
  • 「Hawkins」データセットでは、10個の外れ値(11–14)のうち7つ、レバレッジ点(3–6, 9, 10, 13)のうち7つを検出。高いマスキング効果にもかかわらず、強力な性能を示した。
  • 「Scottish」データセットでは、3つの手法とも観測値7および18を外れ値として正しく特定。提案手法は、観測値33を唯一のレバレッジ点として検出。
  • シミュレートされた「twovariables」データセットでは、3つの外れ値(54–56)をすべて正しく特定し、レバレッジ点は1つ(52)のみを特定。古典的手法およびHadi手法は、3つのレバレッジ点すべてを誤検出していた。
  • 「threevariables」データセットでは、3つのレバレッジ点(51–53)をすべて検出し、外れ値4つ(9, 37, 54–56)を正しく特定。一方、古典的手法およびHadi手法は一部のレバレッジ点を見逃していた。
  • 提案手法は、標準的なハードウェアでも計算的に実行可能であり、テストされたデータセットの実行時間は秒単位。公開のSplus実装も提供可能。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。