[论文解读] Additive Gaussian Processes Revisited
本文提出正交加法核(OAK),一种新型高斯过程核,通过在加法分量间强制正交性来解决加法高斯过程模型中的可识别性问题。通过利用函数ANOVA分解和Sobol指数,OAK在显著减少交互项数量与维度的同时,实现了更优的预测性能——在基准数据集上展现出最先进性能,同时保持了模型的可解释性。
Gaussian Process (GP) models are a class of flexible non-parametric models that have rich representational power. By using a Gaussian process with additive structure, complex responses can be modelled whilst retaining interpretability. Previous work showed that additive Gaussian process models require high-dimensional interaction terms. We propose the orthogonal additive kernel (OAK), which imposes an orthogonality constraint on the additive functions, enabling an identifiable, low-dimensional representation of the functional relationship. We connect the OAK kernel to functional ANOVA decomposition, and show improved convergence rates for sparse computation methods. With only a small number of additive low-dimensional terms, we demonstrate the OAK model achieves similar or better predictive performance compared to black-box models, while retaining interpretability.
研究动机与目标
- 解决加法高斯过程模型中的可识别性问题,即在分量相加时无法唯一确定各分量。
- 通过用少量低维加法函数替代高维交互项,降低模型复杂度。
- 通过功能分量的正交分解,实现可解释性与强大性能兼具的回归与分类模型。
- 在稀疏GP推断中,利用OAK核提升可扩展性与收敛速度。
- 通过解析Sobol指数,提供一种系统化的方法来度量各分量的贡献。
提出的方法
- 提出正交加法核(OAK),通过源自Durrande等人(2012)的约束,强制加法函数之间的正交性。
- 使用函数ANOVA分解,将GP表示为正交的、低维函数之和(主效应与交互项)。
- 采用Sobol指数作为基于方差的分量重要性度量,在OAK框架下具有解析可计算性。
- 应用牛顿-吉拉德恒等式,高效计算核函数,避免交互项数量指数增长。
- 通过诱导点将OAK集成到稀疏GP推断中,利用其有利的特征谱性质,实现更快收敛。
- 采用变分推断与随机优化,使模型可扩展至更大规模数据集。
实验结果
研究问题
- RQ1通过强制正交性,能否在使用更少、更低维分量的情况下,提升加法GP模型的预测性能?
- RQ2强制正交性是否能解决加法GP模型中因分量重叠而引发的可识别性问题?
- RQ3在OAK核框架下,Sobol指数能否实现解析计算,从而实现可靠的分量重要性估计?
- RQ4与标准平方指数核相比,OAK核是否能提升稀疏GP推断中的收敛速度?
- RQ5在真实世界数据集上,OAK能否在保持可解释性的前提下,超越XGBoost和神经网络等黑箱模型?
主要发现
- 在pumadyn数据集上,OAK模型仅使用三个分量(两个一阶项与一个二阶交互项)即达到与原始加法GP模型及完整平方指数GP相当甚至更优的预测性能。
- 在pumadyn数据集上,仅三个项即解释了99%的方差,展现出极高的模型简洁性与可解释性。
- 在SUSY粒子物理数据集上,OAK仅使用十个一维与两个二维分量,即超越基于Dropout的神经网络基线模型。
- 在客户流失数据集上,OAK优于XGBoost,同时提供低维、可解释的分量,为业务提供可操作的洞察。
- 由于更优的特征谱性质,OAK核在稀疏GP推断中显著提升了收敛速度,使大规模数据集训练更快速。
- 在分类任务中,OAK在20个数据集上的平均测试准确率达0.863,对数似然达−0.306,优于多个基线模型,中位排名为4.552。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。