Skip to main content
QUICK REVIEW

[论文解读] Bayesian Information Criterion for Linear Mixed-effects Models

Nan Shen, B. Álvarez González|arXiv (Cornell University)|Apr 30, 2021
Statistical Methods and Bayesian Inference参考文献 10被引用 7
一句话总结

本文通过用有效样本量($n_e$)替代标准样本量,提出了一种用于线性混合效应模型的改进贝叶斯信息准则(BIC)版本。该方法旨在处理聚类或纵向数据等非独立同分布(non-i.i.d.)数据结构。新提出的 BIC$_{n_e}$ 在复杂协方差结构下,相较于传统 BIC 变体,显著提升了模型选择的准确性,且在无需明确知晓随机效应结构的前提下,其表现优于经典 BIC 和混合型 BIC。

ABSTRACT

The use of Bayesian information criterion (BIC) in the model selection procedure is under the assumption that the observations are independent and identically distributed (i.i.d.). However, in practice, we do not always have i.i.d. samples. For example, clustered observations tend to be more similar within the same group, and longitudinal data is collected by measuring the same subject repeatedly. In these scenarios, the assumption in BIC is not satisfied. The concept of effective sample size is brought up and improved BIC is defined by replacing the sample size in the original BIC expression with the effective sample size, which will give us a better theoretical foundation in the circumstance that mixed-effects models involve. Numerical experiment results are also given by comparing the performance of our new BIC with other widely used BICs.

研究动机与目标

  • 为解决标准 BIC 在聚类或纵向数据等非独立同分布数据设置下的局限性,其中观测值存在相关性。
  • 开发一种理论基础坚实的 BIC 变体,通过有效样本量($n_e$)的概念,对数据中的依赖性进行建模。
  • 相较于现有 BIC 公式,提升在线性混合效应模型中模型选择的性能。
  • 将 BIC 的适用范围从独立同分布假设推广至更广泛的真实世界数据,以应对复杂的依赖结构。

提出的方法

  • 将有效样本量($n_e$)定义为信息矩阵迹的倒数,表示具有相同精度的独立观测值的等效数量。
  • 通过在经典 BIC 表达式中以 $n_e$ 替代名义样本量 $n$,推导出改进的 BIC 公式。
  • 应用拉普拉斯近似于边际似然,以在非独立同分布设置下支持 BIC 近似的合理性。
  • 将 BIC$_{n_e}$ 与三种现有 BIC 变体进行比较:BIC$_N$(使用总样本量 $N$)、BIC$_n$(使用每个受试者观测数 $n$)和 BIC$_h$(混合惩罚项)。
  • 通过改变受试者数量($N$)和每个受试者观测数($n_{\text{sub}}$)的模拟研究,评估模型选择的准确性。
  • 基于不同随机效应结构下 64 种模型配置的正确模型选择频率,评估性能表现。

实验结果

研究问题

  • RQ1当将标准 BIC 应用于线性混合效应模型的非独立同分布数据时,其表现如何?
  • RQ2有效样本量($n_e$)能否为依赖数据设置下的 BIC 提供更优的理论基础?
  • RQ3在不同协方差结构下,BIC$_{n_e}$ 与 BIC$_N$、BIC$_n$ 和 BIC$_h$ 在模型选择准确性方面相比如何?
  • RQ4BIC$_{n_e}$ 是否在无需详细了解随机效应结构的前提下,仍能保持优异性能?

主要发现

  • BIC$_{n_e}$ 在所有模拟设计中均持续优于 BIC$_N$ 和 BIC$_n$,尤其在随机效应结构复杂时表现更优。
  • BIC$_{n_e}$ 的性能与需要了解极端协方差情形的混合型 BIC$_h$ 相当,但无需依赖结构假设。
  • 在 $N=20, n_{\text{sub}}=5$ 的模拟中,BIC$_{n_e}$ 的正确选择频率约为 0.85,显著高于 BIC$_N$(0.72)和 BIC$_n$(0.68)。
  • 在 $N=100, n_{\text{sub}}=100$ 的情况下,BIC$_{n_e}$ 维持了高准确性(频率 >0.90),而 BIC$_N$ 和 BIC$_n$ 的性能则因模型结构不同而出现显著波动。
  • BIC$_{n_e}$ 在不同 $N$ 与 $n_{\text{sub}}$ 组合下均表现出稳健性能,表明其对多样化数据配置具有良好的泛化能力。
  • 与 BIC$_h$ 相比,BIC$_{n_e}$ 更易于实现,因其无需根据极端模型情形指定惩罚项。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。