[论文解读] Modular Gaussian Processes for Transfer Learning
该论文提出了一种模块化高斯过程框架用于迁移学习,能够从预训练的、无需数据的高斯过程模块构建元高斯过程模型。通过利用变分推断和基于KL散度的积分增强方法,该方法避免了对原始数据的重新训练,降低了计算成本,并支持多输出和异质似然——在回归、分类和多任务学习基准上实现了最先进性能,且无需重新访问训练数据。
We present a framework for transfer learning based on modular variational Gaussian processes (GP). We develop a module-based method that having a dictionary of well fitted GPs, one could build ensemble GP models without revisiting any data. Each model is characterised by its hyperparameters, pseudo-inputs and their corresponding posterior densities. Our method avoids undesired data centralisation, reduces rising computational costs and allows the transfer of learned uncertainty metrics after training. We exploit the augmentation of high-dimensional integral operators based on the Kullback-Leibler divergence between stochastic processes to introduce an efficient lower bound under all the sparse variational GPs, with different complexity and even likelihood distribution. The method is also valid for multi-output GPs, learning correlations a posteriori between independent modules. Extensive results illustrate the usability of our framework in large-scale and multi-task experiments, also compared with the exact inference methods in the literature.
研究动机与目标
- 为解决在大规模和隐私敏感场景下集中式数据重新处理的局限性。
- 消除在组合模型以应对新任务时重新访问原始训练数据的需求。
- 仅使用预训练GP模块参数,实现高效、可扩展且隐私保护的迁移学习。
- 在不重新训练的前提下,支持多输出和异质似然模型(例如高斯分布、伯努利分布)。
- 通过模块化组合方式,保留跨任务的已学习不确定性度量。
提出的方法
- 该框架使用稀疏变分高斯过程作为模块化组件,每个组件仅存储超参数、伪输入和后验密度。
- 基于两个随机过程之间KL散度的积分算子,推导出一种新颖的下界。
- 通过仅使用其变分参数,无需访问原始数据,即可组合独立的GP模块构建元GP模型。
- 通过应用确定性映射(例如S型函数)将GP输出与似然参数关联,实现对异质似然的支持。
- 在多输出学习中,通过后验学习模块间的相关性,实现在不同输出类型上的联合推断。
- 该方法具有可扩展性和计算效率,其复杂度在模块训练后与原始数据集大小无关。
实验结果
研究问题
- RQ1GP模型能否在不重新训练原始数据的前提下用于新任务,同时保留已学习的不确定性与性能?
- RQ2如何仅使用预训练的GP模块,构建一种原则性、可扩展且隐私保护的迁移学习框架?
- RQ3模块化GP模型在具有异质似然(例如回归与分类)的多样化任务中,其泛化能力达到何种程度?
- RQ4在大规模和多任务设置下,元GP模型的性能与精确推断及最先进方法相比如何?
- RQ5该框架能否在多输出场景中有效学习独立模块之间的相关性?
主要发现
- 在香蕉数据集上,模块化GP框架实现了7.21±0.04的测试NLPD,优于基线变分GP(7.29±7.85×10−4),归因于有效诱导点数量的增加。
- 在美利坚航空公司延误数据集上,元MOGP相比单个GP模块和变分MOGP基线,预测误差仅降低约1%,展现出鲁棒性。
- 在伦敦家庭数据集上,元MOGP在回归任务中实现NLPD=4.18±0.06,在分类任务中实现NLPD=4.78±0.03,且在二值输出上的性能优于独立模块。
- 该方法成功实现了在MNIST像素级分类任务上的无数据元学习,无需重新访问训练数据即可实现准确预测。
- 在多输出实验中,框架在异质输出(高斯与伯努利分布)上均保持了强劲的预测性能,误差指标几乎无下降。
- 该框架展现出良好的可扩展性与效率,计算成本在模块训练后与原始数据集大小无关,适用于大规模和持续学习场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。