Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Information Criterion for Linear Mixed-effects Models

Nan Shen, B. Álvarez González|arXiv (Cornell University)|Apr 30, 2021
Statistical Methods and Bayesian Inference参考文献 10被引用数 7
ひとこと要約

本稿では、クラスタ化されたデータや縦断的データなどの非i.i.d.なデータ構造を考慮するため、標準的な標本サイズの代わりに有効標本サイズ($n_e$)を用いて、線形混合効果モデルにおける修正版ベイジアン情報量基準(BIC)を提案する。新しいBIC$_{n_e}$は、特に複雑な分散共分散構造下でも、従来のBICの変種よりもモデル選択の正確性が向上し、ランダム効果構造の明確な知識がなくても、古典的BICおよびハイブリッドBICを凌駕する。

ABSTRACT

The use of Bayesian information criterion (BIC) in the model selection procedure is under the assumption that the observations are independent and identically distributed (i.i.d.). However, in practice, we do not always have i.i.d. samples. For example, clustered observations tend to be more similar within the same group, and longitudinal data is collected by measuring the same subject repeatedly. In these scenarios, the assumption in BIC is not satisfied. The concept of effective sample size is brought up and improved BIC is defined by replacing the sample size in the original BIC expression with the effective sample size, which will give us a better theoretical foundation in the circumstance that mixed-effects models involve. Numerical experiment results are also given by comparing the performance of our new BIC with other widely used BICs.

研究の動機と目的

  • 非独立同一分布(i.i.d.)でないデータ、例えばクラスタ化や縦断的データにおいて、観測値が相関を持つ場合に標準BICが有効でないという限界を解消すること。
  • 依存性を有効標本サイズ($n_e$)の概念を通じて取り入れる理論的裏付けのあるBICの変種を考案すること。
  • 従来のBICの形式と比較して、線形混合効果モデルにおけるモデル選択性能を向上させること。
  • i.i.d.仮定を超えて一般化することで、複雑な依存構造を有する現実世界のデータに広く適用可能なBICの一般化を図ること。

提案手法

  • 有効標本サイズ($n_e$)を、情報行列のトレースの逆数として定義し、同じ精度を持つ独立観測の等価数を表す。
  • 古典的BIC式における名目上の標本サイズ$n$を$n_e$に置き換えることで、修正されたBICの式を導出する。
  • 非i.i.d.設定下でのBIC近似を正当化するために、周辺尤度に対するラプラス近似を適用する。
  • BIC$_{n_e}$を3つの既存のBIC変種と比較する:BIC$_N$(全標本サイズ$N$を使用)、BIC$_n$(被験者あたりの観測数$n$を使用)、BIC$_h$(ハイブリッドペナルティ)。
  • 被験者数($N$)と被験者あたりの観測数($n_{\text{sub}}$)を変化させたシミュレーションスタディを実施し、モデル選択の正確性を評価する。
  • 異なるランダム効果構造下で64のモデル設定において、正しくモデルが選択された頻度を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1線形混合効果モデルから得られる非i.i.d.データに標準BICを適用した場合、その性能はいかがなものか?
  • RQ2有効標本サイズ($n_e$)は、依存性のあるデータ設定下でBICの理論的基盤をより良くすることができるか?
  • RQ3BIC$_{n_e}$は、異なる分散共分散構造において、BIC$_N$、BIC$_n$、BIC$_h$と比較して、モデル選択の正確性においてどのように差を示すか?
  • RQ4BIC$_{n_e}$は、ランダム効果構造の詳細な知識がなくても、高い性能を維持できるか?

主な発見

  • BIC$_{n_e}$は、すべてのシミュレーション設計において、BIC$_N$およびBIC$_n$を一貫して上回る性能を示し、特にランダム効果構造が複雑な場合に顕著である。
  • BIC$_{n_e}$は、極端な分散共分散ケースの知識を必要とするハイブリッドBIC$_h$と同等の性能を達成するが、構造的仮定を必要としない。
  • N=20、n_{\text{sub}}=5のシミュレーションでは、BIC$_{n_e}$の正しく選択された頻度は約0.85に達し、BIC$_N$(0.72)およびBIC$_n$(0.68)を上回った。
  • N=100、n_{\text{sub}}=100の場合は、BIC$_{n_e}$は高い正確性(頻度>0.90)を維持したが、BIC$_N$およびBIC$_n$はモデル構造に応じて性能に顕著なばらつきを示した。
  • BIC$_{n_e}$の性能は、$N$と$n_{\text{sub}}$の異なる組み合わせに対して安定しており、多様なデータ構成に一般化可能であることが示された。
  • BIC$_{n_e}$は、極端なモデルケースに基づくペナルティ項を指定する必要がないため、BIC$_h$よりも実装が容易である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。