Skip to main content
QUICK REVIEW

[論文レビュー] On Bayesian quantile regression and outliers

Bruno Santos, Heleno Bolfarine|arXiv (Cornell University)|Jan 27, 2016
Bayesian Methods and Mixture Models参考文献 10被引用数 3
ひとこと要約

本稿では、非対称ラプラス混合表現における潜在変数の事後分布を用いて、回帰モデルにおける外れ値を特定するベイジアン分位回帰手法を提案する。スケールパラメータσを固定するのではなく推定可能なものとすることで、条件付き分布から著しく逸脱する観測値、特に異なる分位数領域において顕著に現れる外れ値を同定できる。シミュレーションおよび複数の外れ値を有するブラジルのジニ指数データにおいて、その有効性が示された。

ABSTRACT

In this work we discuss the progress of Bayesian quantile regression models since their first proposal and we discuss the importance of all parameters involved in the inference process. Using a representation of the asymmetric Laplace distribution as a mixture of a normal and an exponential distribution, we discuss the relevance of the presence of a scale parameter to control for the variance in the model. Besides that we consider the posterior distribution of the latent variable present in the mixture representation to showcase outlying observations given the Bayesian quantile regression fits, where we compare the posterior distribution for each latent variable with the others. We illustrate these results with simulation studies and also with data about Gini indexes in Brazilian states from years with census information.

研究の動機と目的

  • 固定されたスケールパラメータσ(σ)によるベイジアン分位回帰の限界を是正すること。これは分散制御と推論に歪みをもたらす可能性がある。
  • 非対称ラプラス混合表現における潜在変数の事後分布を分析することで、外れ値を特定するロバストな手法を開発すること。
  • 複数の外れ値が異なる分位数に異なる影響を及えること、したがって分位数ごとの外れ値検出が不可欠であることを示すこと。
  • 事後潜在変数分布を活用することで、ケース削除診断の計算コストの高い代替手段を提供すること。
  • σを固定すると、特に高次元または汚染されたデータにおいて、事後共分散行列が信頼できず、推定が偏る傾向があることの実証

提案手法

  • 非対称ラプラス分布のスケール混合表現を用い、指数分布を混合変数とする正規分布の分散-平均混合として表現する。
  • 各観測値$i$の潜在変数$v_i$をモデル化し、その事後分布が残差が条件付き分位数からどれほど逸脱しているかを反映することを目的とする。
  • MCMCサンプリングを用いて回帰係数、σ、および潜在変数$v_i$の同時事後分布を推定し、完全なベイジアン推論を可能にする。
  • 観測値間での$v_i$の事後分布を比較し、極端な値を示すものを外れ値として同定する。
  • 各$v_i$の事後分布と平均事後分布との間のカルバック・ライブラー距離を用いて、外れ度合いを定量化する。
  • 外れ値である確率の平均事後確率を診断指標として用い、値が大きいほど乖離度が顕著であることを示す。

実験結果

リサーチクエスチョン

  • RQ1ベイジアン分位回帰においてスケールパラメータσを固定することは、事後推論および外れ値検出にどのような影響を及えるか?
  • RQ2潜在変数$v_i$の事後分布は、ベイジアン分位回帰における外れ観測値を信頼できる指標として機能するか?
  • RQ3複数の外れ値が異なる分位数に与える影響は何か?また、それらは個別に検出可能か?
  • RQ4σを事後分布から推定するのとσを1に固定するのとでは、モデルの適合度と推論の正確性にどのような差が生じるか?
  • RQ5提案手法は、下側分位数や上側分位数といった、条件付き分布の異なる部分に影響を与える外れ値を検出可能か?

主な発見

  • 潜在変数$v_i$の事後分布は、特に下位分位数および上位分位数において、データの大部分から著しく離れた観測値を効果的に同定できる。
  • 2010年、2000年、1991年のブラジル連邦直轄領(Federal District)の観測値は、低ジニ指数の期待とは対照的に高い収入および教育水準を示したが、0.1th分位数で外れ値として特定された。
  • 2010年のサンタカタリーナ州(Santa Catarina)は、他の州に比べて著しく低いジニ指数(0.49)を示したが、次に低い州(0.53)より顕著に低く、0.9th分位数で外れ値として特定された。
  • この手法により、外れ値が分位数ごとに回帰推定値に異なる影響を及えることが判明し、複数の外れ値が存在するシミュレーションではバイアスの増大が観察された。
  • σを1に固定すると、事後共分散行列が信頼できず推論が不正確になるが、σを事後分布から推定することでモデルのロバスト性と分散制御が向上する。
  • カルバック・ライブラー距離と外れ値である確率の平均事後確率は、極端な観測値を一貫的かつ解釈可能な形で特定するための有効な指標を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。