Skip to main content
QUICK REVIEW

[论文解读] Bayesian leave-one-out cross-validation for large data

Måns Magnusson, Michael Riis Andersen|arXiv (Cornell University)|Apr 24, 2019
Statistical Methods and Bayesian Inference被引用 16
一句话总结

本文提出一种可扩展的贝叶斯留一法交叉验证(LOO-CV)方法,通过结合近似推断(如拉普拉斯近似、ADVI)与概率与大小成比例(PPS)子采样,实现对大规模数据集的高效处理。该方法在保持统计一致性的同时,通过帕累托-k形状参数等诊断工具评估近似质量与子采样不确定性,实现对预期对数预测密度(elpd)的稳定估计。

ABSTRACT

Model inference, such as model comparison, model checking, and model selection, is an important part of model development. Leave-one-out cross-validation (LOO) is a general approach for assessing the generalizability of a model, but unfortunately, LOO does not scale well to large datasets. We propose a combination of using approximate inference techniques and probability-proportional-to-size-sampling (PPS) for fast LOO model evaluation for large datasets. We provide both theoretical and empirical results showing good properties for large data.

研究动机与目标

  • 解决标准LOO-CV在大规模数据集上计算不可行的问题,即每个被剔除的观测都需要完整后验估计。
  • 通过利用后验近似与子采样,突破MCMC与重要性采样在可扩展性上的瓶颈。
  • 在大样本渐近条件下,确保预期对数预测密度(elpd)估计的一致性,同时保持准确性。
  • 提供诊断工具——特别是帕累托-k形状参数与HH估计器的方差——以评估后验近似的可靠性与子采样不确定性。
  • 通过降低计算成本而不牺牲统计一致性,实现大规模贝叶斯建模中实用的模型比较与选择。

提出的方法

  • 使用概率与大小成比例(PPS)采样从完整数据集中抽取代表性子样本,从而减少LOO计算次数。
  • 应用后验近似(如拉普拉斯近似、均场ADVI)一次性估计完整后验,随后通过重要性采样在所有LOO计算中复用该后验。
  • 采用帕累托平滑重要性采样(PSIS)以稳定用于估计每个被剔除观测对数预测密度的重要权重。
  • 利用广义帕累托分布估计的形状参数 $\hat{k}$ 诊断后验近似质量,识别高杠杆观测点。
  • 估计分层霍尔维茨-汤普森(HH)估计器的方差,以量化子采样带来的不确定性,实现精度评估。
  • 将子采样与PSIS-LOO结合,高效计算 $\widehat{\text{elpd}}_{\text{loo}}$,同时在正则模型中保持一致性与有限样本下的稳健性。

实验结果

研究问题

  • RQ1LOO-CV能否在不牺牲统计一致性的前提下,实现对大规模数据集的计算可行性?
  • RQ2在大规模模型评估的PSIS-LOO背景下,常见后验近似(如拉普拉斯近似、ADVI)的性能如何?
  • RQ3与完整LOO-CV相比,PPS子采样在多大程度上保持了LOO-CV估计的准确性?
  • RQ4诊断工具如 $\hat{k}$ 形状参数能否在大规模数据设置中可靠识别不可靠的后验近似?
  • RQ5在使用近似后验的子采样LOO-CV中,计算效率与估计精度之间的权衡如何?

主要发现

  • 所提方法在大样本渐近条件下,即使使用拉普拉斯近似与均场ADVI等近似后验,仍能实现 $\text{elpd}_{\text{loo}}$ 的一致估计。
  • 对于正则模型,该方法保持了一致性与准确性,$\hat{k}$ 诊断能有效识别不良后验近似——例如 $\hat{k} > 0.7$ 表明估计不可靠。
  • 使用大小为500的子样本,该方法在不到2秒内完成模型比较的精度要求,而完整MCMC则需约35秒,且使用拉普拉斯近似。
  • HH估计器的方差 ($v(\widehat{\text{elpd}}_{\text{loo}})$) 提供了对子采样不确定性可靠度量,所有模型的 $\sigma_{\text{loo}} \approx 90$。
  • 在真实数据示例中,该方法正确识别出模型6(可变截距与斜率)优于模型4,$\text{elpd}_{\text{loo}}$ 差异为 220 ± 26,与完整MCMC结果一致。
  • 该方法在计算效率上优于10折交叉验证,同时得出结论相近,避免了需重训练模型10次的需要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。