Skip to main content
QUICK REVIEW

[論文レビュー] Semiparametric Mixture Regression with Unspecified Error Distributions

Yanyuan Ma, Shaoli Wang|arXiv (Cornell University)|Nov 2, 2018
Bayesian Methods and Mixture Models参考文献 15被引用数 4
ひとこと要約

本稿では、誤差分布の正規性仮定を緩和するために、未指定の成分誤差密度を許容する半パラメトリック混合線形回帰モデルを提案する。カーネル密度推定に基づくEMアルゴリズムを用いることで、一貫性のある推定と漸近正規性を達成し、非正規誤差下では従来のMLEを著しく上回り、正規性下でも同等の性能を維持することが、シミュレーションおよび実際のエクイニーバイラス負荷データセットを通じて示された。

ABSTRACT

In fitting a mixture of linear regression models, normal assumption is traditionally used to model the error and then regression parameters are estimated by the maximum likelihood estimators (MLE). This procedure is not valid if the normal assumption is violated. To relax the normal assumption on the error distribution hence reduce the modeling bias, we propose semiparametric mixture of linear regression models with unspecified error distributions. We establish a more general identifiability result under weaker conditions than existing results, construct a class of new estimators, and establish their asymptotic properties. These asymptotic results also apply to many existing semiparametric mixture regression estimators whose asymptotic properties have remained unknown due to the inherent difficulties in obtaining them. Using simulation studies, we demonstrate the superiority of the proposed estimators over the MLE when the normal error assumption is violated and the comparability when the error is normal. Analysis of a newly collected Equine Infectious Anemia Virus data in 2017 is employed to illustrate the usefulness of the new estimator.

研究の動機と目的

  • 従来の混合回帰モデルで誤差が正規であると仮定することによって生じるモデル化バイアスを是正すること。
  • 識別可能性と漸近的性質を維持しつつ、未指定の誤差密度を許容する半パラメトリック推定量を開発すること。
  • 従来の手法よりも弱い条件下でも、提案された推定量の一貫性および漸近正規性を確立すること。
  • 誤差が正規から逸脱する有限標本において、分類精度とロバストネスの向上を実証すること。
  • パラメトリックMLEの代替として、理論的裏付けがあり、柔軟な混合回帰設定における代替手段を提供すること。

提案手法

  • 成分誤差密度を未指定とし、正規密度の代わりに平均0、分散1の一般密度関数gを用いる半パラメトリック混合回帰モデルを提案する。
  • 回帰パラメータθの推定と、カーネル密度推定を用いた誤差密度gの非パラメトリック推定を交互に繰り返す半パラメトリックEMアルゴリズムを導入する。
  • 交差検証を用いてバンド幅を選択することで、滑らかさと一貫性を確保するカーネル密度推定量を誤差密度に用いる。
  • 非同一分散パラメータτjおよび任意の成分密度g_jを許容する一般条件のもとで、モデルの識別可能性を確立する。
  • 提案された推定量の漸近分布を導出し、正則性条件の下で一貫性および漸近正規性を示す。
  • 分類性能を評価するために、実データに本手法を適用し、1つずつ除外する交差検証を用いる。

実験結果

リサーチクエスチョン

  • RQ1未指定の誤差密度を伴う半パラメトリック混合回帰モデルは、正規性を仮定しない状況でも一貫性のある推定を達成できるか?
  • RQ2一般の半パラメトリック混合回帰フレームワークにおいて、モデルの識別性を保証する最小限の正則性条件は何か?
  • RQ3誤差分布が非正規である場合、提案された推定量の性能はMLEと比べてどうなるか?
  • RQ4有限標本において、従来のMLEと比較して、提案された手法は分類精度を向上させるか?
  • RQ5提案された推定量の漸近理論は、以前の漸近的性質が未確認であった多くの既存の半パラメトリック混合回帰推定量にも適用可能か?

主な発見

  • EIAVデータセットにおいて、KDEEM推定量は100%の正しく分類された割合(CCP)を達成したのに対し、MLEEMは93.33%であった。これは、分類性能の優位性を示している。
  • 非正規誤差分布下のシミュレーション研究において、提案された推定量はMLEを著しく上回り、モデル化バイアスを低減し、推定精度を向上させた。
  • 誤差が実際に正規である場合でも、MLEと同等の性能を維持したため、分布仮定の変化に対してロバストであることが示された。
  • 理論的結果により、従来の識別性結果よりも弱い条件下でも、提案された推定量の一貫性および漸近正規性が確立された。
  • 漸近理論は、以前の漸近的性質が未確認であった多くの既存の半パラメトリック混合回帰推定量にも適用可能である。
  • カーネルベースの誤差密度推定により、パラメトリック仮定なしに複雑な誤差構造を柔軟にモデル化できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。