Skip to main content
QUICK REVIEW

[论文解读] Autocorrelated errors in experimental data in the language sciences: Some solutions offered by Generalized Additive Mixed Models

R. Harald Baayen, Jacolien van Rij|arXiv (Cornell University)|Jan 8, 2016
Bayesian Modeling and Causal Inference参考文献 11被引用 13
一句话总结

本文提出使用广义可加混合模型(GAMMs)结合自回归(ar1)误差结构与因子平滑项,以解决语言科学实验中的自相关误差问题。通过建模非线性随机效应并显式处理残差的时间序列依赖性,GAMMs 降低了过于保守的 p 值,产生了更可解释、更稳定的非线性效应,该方法在单词命名、音高轮廓和脑电图(EEG)数据分析中得到了验证。

ABSTRACT

A problem that tends to be ignored in the statistical analysis of experimental data in the language sciences is that responses often constitute time series, which raises the problem of autocorrelated errors. If the errors indeed show autocorrelational structure, evaluation of the significance of predictors in the model becomes problematic due to potential anti-conservatism of p-values. This paper illustrates two tools offered by Generalized Additive Mixed Models (GAMMs) (Lin and Zhang, 1999; Wood, 2006, 2011, 2013) for dealing with autocorrelated errors, as implemented in the current version of the fourth author's mgcv package (1.8.9): the possibility to specify an ar(1) error model for Gaussian models, and the possibility of using factor smooths for random-effect factors such as subject and item. These factor smooths are set up to have the same smoothing parameters, and are penalized to yield the non-linear equivalent of random intercepts and random slopes in the classical linear framework. Three case studies illustrate these issues.

研究动机与目标

  • 解决语言科学实验数据中广泛存在但常被忽视的自相关误差问题。
  • 证明当残差存在自相关性时,标准线性混合模型可能产生过于保守的 p 值。
  • 展示 GAMMs 提供了两种关键工具——因子平滑项与 ar(1) 误差结构——以建模非线性随机效应与自相关残差。
  • 说明校正自相关性如何带来对非线性效应更准确、更可解释的估计,以真实语言科学数据集为例。
  • 倡导在行为或神经生理响应数据存在时间序列依赖性时,使用 GAMMs 作为传统模型的更优替代方案。

提出的方法

  • 使用广义可加混合模型(GAMMs)来建模语言科学数据中预测变量与响应变量之间的非线性关系。
  • 应用薄板回归样条(tprs)与张量积样条(tp)来建模连续预测变量及其交互作用的平滑、波动效应。
  • 通过共享平滑参数与惩罚项实现因子平滑项对随机效应(如被试、项目)的建模,以在非线性框架下模拟随机截距与斜率。
  • 通过 mgcv 包中的 rho 参数引入 ar(1) 误差结构,显式建模并校正残差自相关性。
  • 使用差异平滑项来建模因子水平之间的对比,类似于线性模型中的治疗对比。
  • 通过模型比较与残差诊断,评估 ar(1) 与因子平滑项在白化残差与提升模型拟合度方面的有效性。

实验结果

研究问题

  • RQ1实验响应数据中的残差自相关性在标准线性混合模型中在多大程度上导致 p 值过于保守?
  • RQ2当响应随时间的变化模式非线性时,GAMMs 中的因子平滑项能否有效建模被试与项目的非线性随机效应?
  • RQ3在语言实验的时间序列数据中,GAMMs 中包含 ar(1) 误差结构是否能显著改善残差白化与模型有效性?
  • RQ4校正自相关性如何影响反应潜伏期、音高轮廓与脑电图振幅数据中非线性效应的功能形式与可解释性?
  • RQ5在捕捉语言科学数据中复杂的时间依赖性方面,结合 ar(1) 与因子平滑项的 GAMMs 与传统线性混合模型相比,在哪些方面表现更优?

主要发现

  • 在单词命名数据中,被试的因子平滑项捕捉到了随时间变化的非线性表现趋势,且 ar(1) 的 rho 值为 0.3 即足以白化残差并降低自相关性。
  • 在音高轮廓数据中,仅使用因子平滑项无法消除强烈的自相关性,需将 ar(1) 的 rho 值提高至 0.85–0.9 才能实现残差白化。
  • 在脑电图(EEG)数据中,引入 ar(1) 误差后,原本复杂且过度波动的非线性表面被简化为更清晰、更易解释的线性效应,尤其在条件间差异表面中表现明显。
  • ar(1) 模型减少了部分效应图中的过拟合与过度波动,特别是在交互作用表面的右下角区域,该区域原本噪声被显著放大。
  • 去除自相关性后,p 值变得更保守,效应的功能形式也发生变化,例如非线性交互作用在校正后变得明显为线性。
  • 在一种情况下,时间与固定因子的交互作用原本显著,但在引入因子平滑项后变为不显著,表明原始显著性是由未建模的非线性随机效应所驱动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。