Skip to main content
QUICK REVIEW

[论文解读] Investigating the Impact of Model Misspecification in Neural Simulation-based Inference

Patrick Cannon, Daniel L. Ward|arXiv (Cornell University)|Sep 5, 2022
Machine Learning and Algorithms被引用 11
一句话总结

本文研究了在模型误设情况下的神经模拟推断(SBI)方法性能,发现即使数据存在微小扰动,NRE、NPE 和 NLE 的后验分布也会出现严重校准偏差。尽管测试了集成后验和锐度感知最小化(SAM)等缓解策略,但没有任何方法能完全恢复鲁棒性,凸显了在实际应用中确保可靠推断亟需新方法。

ABSTRACT

Aided by advances in neural density estimation, considerable progress has been made in recent years towards a suite of simulation-based inference (SBI) methods capable of performing flexible, black-box, approximate Bayesian inference for stochastic simulation models. While it has been demonstrated that neural SBI methods can provide accurate posterior approximations, the simulation studies establishing these results have considered only well-specified problems -- that is, where the model and the data generating process coincide exactly. However, the behaviour of such algorithms in the case of model misspecification has received little attention. In this work, we provide the first comprehensive study of the behaviour of neural SBI algorithms in the presence of various forms of model misspecification. We find that misspecification can have a profoundly deleterious effect on performance. Some mitigation strategies are explored, but no approach tested prevents failure in all cases. We conclude that new approaches are required to address model misspecification if neural SBI algorithms are to be relied upon to derive accurate scientific conclusions.

研究动机与目标

  • 评估最先进神经 SBI 方法在模型误设情况下的鲁棒性,这是现实应用中常见但研究不足的情境。
  • 识别现有缓解策略(如集成后验和锐度感知最小化)是否能在误设条件下恢复可靠的后验近似。
  • 在多个误设模拟任务中对神经 SBI 方法(NRE、NPE、NLE)和 ABC 进行基准测试,以评估其泛化能力和失效模式。
  • 证明模型误设会导致系统性后验过度自信和覆盖度差,从而削弱人们对神经 SBI 在高风险科学推断中可靠性的信任。
  • 呼吁开发新方法论,以确保神经 SBI 在面对实际中常见的模型-数据差异时具备鲁棒性。

提出的方法

  • 在三个模拟任务(TG-SS、SLCP 和 SV-SS)上对神经 SBI 方法(NRE、NPE、NLE)和 ABC 进行全面基准测试,评估其在逐步增加的模型误设水平下的表现。
  • 引入受控的数据变换(如波动率冲击和加性高斯噪声),在保持与真实数据生成过程结构相似性的同时模拟模型误设。
  • 使用来自 sbibm 库的 MCMC 求解器生成参考后验分布,以评估所有方法和误设水平下的后验校准和覆盖度。
  • 通过组合多个训练好的后验网络来应用集成后验,以提升对分布偏移的鲁棒性。
  • 在训练过程中采用锐度感知最小化(SAM),以增强对分布外数据的泛化能力,尤其是在误设条件下。
  • 通过覆盖度指标(如真实参数落在可信区间内的比例)和后验方差来衡量性能,以评估过度自信和校准偏差。

实验结果

研究问题

  • RQ1当模拟器与数据生成过程因模型误设而不匹配时,神经 SBI 方法(NRE、NPE、NLE)表现如何?
  • RQ2集成后验和锐度感知最小化(SAM)在多大程度上能提升神经 SBI 在误设条件下的鲁棒性?
  • RQ3与神经 SBI 方法相比,近似贝叶斯计算(ABC)在模型误设下是否仍保持可靠性?
  • RQ4神经 SBI 方法在误设下的失效是跨不同任务和模型类型系统性的,还是方法特异性的?
  • RQ5当数据存在噪声或模型假设被违反时,当前的神经 SBI 技术能否被信赖用于高风险科学推断?

主要发现

  • 在模型误设下,神经 SBI 方法(NRE、NPE、NLE)表现出严重的后验校准偏差,随着误设程度增加,后验估计出现过度自信且覆盖度差。
  • 即使微小的数据扰动——如随机波动率模型中的 10% 波动率冲击——也会导致后验估计无法覆盖真实后验质量,表明存在系统性失效。
  • ABC 展现出对误设的优越鲁棒性,即使在模型偏差较高的情况下,其后验也仅表现出轻微的过度自信。
  • 集成后验在结合稳健训练时可部分缓解校准偏差,但无法在所有任务中完全恢复覆盖度。
  • 锐度感知最小化(SAM)对 NRE 和 NLE 有性能提升,但对 NPE 无改善,表明其在不同方法间泛化能力有限。
  • 所有测试的缓解策略均无法完全防止误设下的失败,凸显了在神经 SBI 中亟需开发新型鲁棒推断框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。