Skip to main content
QUICK REVIEW

[论文解读] Variational Learning on Aggregate Outputs with Gaussian Processes

Ho Chung Leon Law, Dino Sejdinović|arXiv (Cornell University)|May 22, 2018
Machine Learning and Data Classification被引用 18
一句话总结

本文提出了一种用于具有聚合输出的高斯过程模型的变分贝叶斯推断框架,通过使用模型证据的可 tractable 下界,解决了从粗粒度标签学习的挑战。该方法在大规模数据集(超过一百万条观测值)上实现了最先进性能,并在具有泊松分布计数数据的细粒度疟疾发病率制图中展现出卓越的不确定性量化能力和可扩展性。

ABSTRACT

While a typical supervised learning framework assumes that the inputs and the outputs are measured at the same levels of granularity, many applications, including global mapping of disease, only have access to outputs at a much coarser level than that of the inputs. Aggregation of outputs makes generalization to new inputs much more difficult. We consider an approach to this problem based on variational learning with a model of output aggregation and Gaussian processes, where aggregation leads to intractability of the standard evidence lower bounds. We propose new bounds and tractable approximations, leading to improved prediction accuracy and scalability to large datasets, while explicitly taking uncertainty into account. We develop a framework which extends to several types of likelihoods, including the Poisson model for aggregated count data. We apply our framework to a challenging and important problem, the fine-scale spatial modelling of malaria incidence, with over 1 million observations.

研究动机与目标

  • 解决当输出聚合在比输入更粗粒度层级时的监督学习挑战,这是空间流行病学和遥感中的常见问题。
  • 开发一种使用指数族似然的聚合输出统一建模框架,重点关注泊松分布计数数据。
  • 在聚合条件下实现高斯过程模型的可扩展且可 tractable 的变分推断,克服标准证据下界中的不可 tractable 性问题。
  • 在预测中显式纳入不确定性量化,这对公共卫生决策至关重要。
  • 在真实世界的大规模数据集上展示该方法的有效性,包括超过一百万条观测值的疟疾发病率制图。

提出的方法

  • 提出一种新颖的模型证据变分下界,考虑了输出聚合,使具有聚合输出的高斯过程模型实现可 tractable 推断。
  • 引入一种使用诱导点和潜在函数值上变分分布的随机变分推断方法,确保在大规模数据集上的可扩展性。
  • 采用结构化变分近似,其中潜在函数的后验被建模为多变量正态分布,其均值和协方差参数通过基于梯度的方法进行优化。
  • 通过聚合模型的一般指数族公式化,将框架适应于多种似然族,包括高斯和泊松分布。
  • 使用重参数化技巧进行梯度估计,并对聚合似然应用拉普拉斯近似以提高可 tractability。
  • 使用 ARD 核学习输入特定的长度尺度,增强高维输入空间中模型的灵活性和可解释性。

实验结果

研究问题

  • RQ1能否使具有聚合输出的高斯过程模型的变分推断在可 tractable 且可扩展,特别是在由于对未观测的个体水平数据进行边际化而导致似然不可 tractable 的情况下?
  • RQ2与标准证据下界相比,所提出的变分下界在聚合数据上的预测准确性和不确定性校准方面表现如何?
  • RQ3该方法在多大程度上可扩展至大规模数据集——特别是超过一百万条观测值——同时保持预测性能和不确定性量化?
  • RQ4该框架在真实世界的空间疾病制图任务中表现如何,例如按行政单位聚合的细粒度疟疾发病率预测?
  • RQ5所提出的显式优化校准的损失函数是否相比标准 NLL 基于的损失函数能产生更好的不确定性估计?

主要发现

  • VBAgg-Obj 模型在瑞士卷数据集上实现了最低的个体 NLL 和 MSE,且与 Nyström 和神经网络基线相比具有统计显著性。
  • 在电梯机数据集上,VBAgg-Obj 的个体 NLL(-1.71)和 MSE(0.0018)均低于 Nyström(NLL:-1.57,MSE:0.0024)和 NN(NLL:-1.64,MSE:0.0021),Wilcoxon 符号秩检验的 p 值均小于 0.001。
  • 该方法能有效扩展至超过一百万条观测值的数据集,展示了在大规模空间建模中的实际可行性。
  • VBAgg-Obj 在不确定性估计方面表现出更优的校准性,校准图显示 70%–95% 预测区间内的绝对覆盖误差更接近于零。
  • 该框架成功地从粗粒度的区级病例计数中建模细粒度的疟疾发病率,实现了准确预测并显式量化了不确定性。
  • 使用泊松似然与高斯过程先验,使计数数据在空间流行病学中建模更加稳健,其在预测准确性和不确定性校准方面均优于现有方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。