Skip to main content
QUICK REVIEW

[论文解读] An approximate KLD based experimental design for models with intractable likelihoods

Ziqiao Ao, Jinglai Li|arXiv (Cornell University)|Apr 1, 2020
Probabilistic and Robust Engineering Design参考文献 23被引用 6
一句话总结

本文提出了一种用于似然函数难以计算的贝叶斯实验设计的下界Kullback-Leibler散度(LB-KLD)效用。通过将效用表示为数据空间熵的和,该方法无需计算似然函数即可通过熵估计实现高效评估,在后验分布非高斯的情况下优于基于后验协方差的方法。

ABSTRACT

Data collection is a critical step in statistical inference and data science, and the goal of statistical experimental design (ED) is to find the data collection setup that can provide most information for the inference. In this work we consider a special type of ED problems where the likelihoods are not available in a closed form. In this case, the popular information-theoretic Kullback-Leibler divergence (KLD) based design criterion can not be used directly, as it requires to evaluate the likelihood function. To address the issue, we derive a new utility function, which is a lower bound of the original KLD utility. This lower bound is expressed in terms of the summation of two or more entropies in the data space, and thus can be evaluated efficiently via entropy estimation methods. We provide several numerical examples to demonstrate the performance of the proposed method.

研究动机与目标

  • 解决似然函数难以计算且无法以闭式表达的贝叶斯实验设计(BED)问题。
  • 开发一种效用函数,以近似计算先验与后验分布之间的Kullback-Leibler散度(KLD),而无需进行似然函数计算。
  • 在后验分布显著偏离高斯分布的情境下实现高效的实验设计,克服基于后验协方差方法的局限性。
  • 提供一种数值上可行的KLD实验设计替代方案,其依赖于熵估计而非似然计算。

提出的方法

  • 推导出仅依赖于不同参数设置下数据生成分布熵的KLD效用函数的下界。
  • 将该下界表示为数据空间中熵的和,可使用非参数熵估计技术进行估计。
  • 采用先验划分策略将参数划分为若干簇,以实现对每个簇的局部熵估计。
  • 使用蒙特卡洛采样估计先验下的期望效用,其中熵近似替代了直接的似然评估。
  • 采用嵌套蒙特卡洛方案与基于KLD的效用进行基准对比,而LB-KLD方法完全避免了似然查询。
  • 基于先验预测样本的聚类执行先验划分步骤,以提高熵估计的准确性。

实验结果

研究问题

  • RQ1能否构建一种KLD效用的下界近似,避免在似然函数难以计算的模型中直接进行似然评估?
  • RQ2与现有无需似然的ED方法相比,所提出的LB-KLD方法在后验分布非高斯时的性能如何?
  • RQ3先验划分策略和熵估计精度对LB-KLD效用性能有何影响?
  • RQ4当后验分布与高斯分布相去甚远时,LB-KLD方法是否仍能一致地识别出最优实验设计?

主要发现

  • 所提出的LB-KLD方法成功在无需似然评估的情况下近似了基于KLD的效用,从而实现了对似然函数难以计算模型的实验设计。
  • 在后验分布非高斯的情境下,该方法优于D-后验精度方法,尤其在Ricker模型和蚜虫种群模型示例中表现更优。
  • 数值结果表明,LB-KLD方法识别出的最优设计参数能带来比其他无需似然方法更高的信息增益。
  • 该方法在多种模型中表现出稳健性,包括数学示例、Ricker模型和蚜虫种群动力学模型,在100次独立运行中均保持一致性能。
  • 通过先验划分实现的熵估计仅需3×10⁴次模型模拟即可实现准确的效用评估,与KLD基准的嵌套蒙特卡洛方法相比显著降低了计算成本。
  • 当后验分布与高斯分布显著偏离时,该方法依然有效,而基于后验协方差的方法则会失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。