Skip to main content
QUICK REVIEW

[论文解读] Multi-task Learning for Aggregated Data using Gaussian Processes

Fariba Yousefi, Michael Thomas Smith|arXiv (Cornell University)|Jun 22, 2019
Gaussian Processes and Bayesian Inference参考文献 35被引用 6
一句话总结

本文提出了一种用于聚合数据的多任务高斯过程模型,通过在不同空间或时间尺度上对变量进行联合学习,利用在可变输入尺度上积分的潜在函数实现。通过将每个任务建模为共享潜在过程的线性组合,并结合具有随机变分推断的异质似然函数,该框架提升了预测准确性——在空气质量建模中,通过结合低成本高频传感器与高精度低频数据,SMSE降低了33%。

ABSTRACT

Aggregated data is commonplace in areas such as epidemiology and demography. For example, census data for a population is usually given as averages defined over time periods or spatial resolutions (cities, regions or countries). In this paper, we present a novel multi-task learning model based on Gaussian processes for joint learning of variables that have been aggregated at different input scales. Our model represents each task as the linear combination of the realizations of latent processes that are integrated at a different scale per task. We are then able to compute the cross-covariance between the different tasks either analytically or numerically. We also allow each task to have a potentially different likelihood model and provide a variational lower bound that can be optimised in a stochastic fashion making our model suitable for larger datasets. We show examples of the model in a synthetic example, a fertility dataset, and an air pollution prediction application.

研究动机与目标

  • 解决流行病学、人口统计学和环境传感等领域中多尺度聚合数据建模的挑战,其中观测数据在不同空间或时间支持下采集。
  • 克服现有GP模型假设输入支持一致或似然函数同质的局限,特别是在处理跨不同数据分辨率的混合类型输出(如连续型、计数型、二值型)时的不足。
  • 开发一种可扩展且灵活的框架,实现具有不同输入支持和似然模型的多个任务的联合学习,同时通过共享潜在过程保持任务间的相关性。
  • 通过利用高频、低精度数据来指导低分辨率、高精度观测,实现高分辨率、高保真度的预测。

提出的方法

  • 将每个任务建模为潜在高斯过程的线性组合,其中观测到的任务输出是潜在函数在其特定支持(如时间区间或空间区域)上的积分。
  • 使用核心区域化线性模型(LMC)表示任务间的协方差,允许异质似然函数(如高斯分布、泊松分布等)以及任务间灵活的依赖结构。
  • 通过在其各自支持上对潜在GP核函数进行积分,推导出任务间协方差的解析或数值表达式,实现任务间相关性的精确计算。
  • 在潜在函数层面引入诱导输入,通过随机变分推断(SVI)实现可扩展推断,降低大规模数据集的计算复杂度。
  • 构建支持使用小批量数据进行随机优化的变分下界,实现对大规模聚合数据集的高效训练。
  • 应用变分EM算法联合优化超参数和潜在变量,实现模型结构与参数的端到端学习。

实验结果

研究问题

  • RQ1高斯过程如何扩展以建模多任务学习问题,其中每个任务定义在不同的输入支持上(如时间段或空间区域),且可能具有不同的似然函数?
  • RQ2是否可以通过潜在GP积分,对具有不同支持的任务之间的协相关性进行解析或数值计算?其对预测性能有何影响?
  • RQ3在环境监测应用中,整合高频、低精度传感器数据在多大程度上能提升低分辨率、高精度预测的准确性?
  • RQ4在具有异质似然函数和多尺度支持的多任务GP模型中,如何实现可扩展推断,特别是在大规模数据集上?
  • RQ5当应用于真实世界的聚合数据时,所提出的框架是否能在预测准确性和鲁棒性方面优于单任务模型或现有多任务GP方法?

主要发现

  • 在PM2.5预测中,将高频低成本传感器数据与低频高精度测量数据结合时,模型实现了统计上显著的33% SMSE降低(0.439 ± 0.114 vs. 0.657 ± 0.100)。
  • 即使传感器数据存在偏差,包含高频、低精度数据仍能提升对潜在污染水平的预测准确性,归因于模型从多分辨率观测中学习的能力。
  • 该框架成功保持了低分辨率数据(如6小时平均值)的积分约束,同时生成与观测趋势一致的高分辨率预测。
  • 在潜在空间中使用诱导点实现了可扩展推断,通过随机变分推断使模型在大规模数据集上具有可处理性。
  • 该模型对异质似然函数和不同输入支持表现出鲁棒性,在合成数据和真实世界应用中均优于单任务基线模型。
  • 采用小批量数据的变分EM算法实现了高效优化,支持该模型在大规模真实环境监测问题中的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。