Skip to main content
QUICK REVIEW

[论文解读] Weighted Ensembles for Active Learning with Adaptivity

Konstantinos D. Polyzos, Qin Lu|arXiv (Cornell University)|Jun 10, 2022
Gaussian Processes and Bayesian Inference被引用 7
一句话总结

本文提出一种用于主动学习的自适应加权高斯过程集成模型(EGP),其中核函数权重可随已标注数据动态调整,从而提升模型表达能力。该方法引入了集成型采集函数,增强了鲁棒性与性能,在合成数据、医学数据和机器人数据集上的回归与不确定性量化任务中,均优于单高斯过程基线模型。

ABSTRACT

Labeled data can be expensive to acquire in several application domains, including medical imaging, robotics, and computer vision. To efficiently train machine learning models under such high labeling costs, active learning (AL) judiciously selects the most informative data instances to label on-the-fly. This active sampling process can benefit from a statistical function model, that is typically captured by a Gaussian process (GP). While most GP-based AL approaches rely on a single kernel function, the present contribution advocates an ensemble of GP models with weights adapted to the labeled data collected incrementally. Building on this novel EGP model, a suite of acquisition functions emerges based on the uncertainty and disagreement rules. An adaptively weighted ensemble of EGP-based acquisition functions is also introduced to further robustify performance. Extensive tests on synthetic and real datasets showcase the merits of the proposed EGP-based approaches with respect to the single GP-based AL alternatives.

研究动机与目标

  • 解决单核高斯过程在主动学习中因核函数选择固定而导致的表达能力有限问题。
  • 通过动态加权多个GP模型,提升在医学影像和机器人等在线、数据稀缺环境中的模型适应能力。
  • 基于EGP框架,开发一系列基于不确定性和分歧度的采集函数。
  • 通过自适应加权集成多个采集函数,提升在多样化任务中的鲁棒性。
  • 在真实世界和合成数据集上,证明EGP方法在预测误差和不确定性校准方面显著优于单GP基线模型。

提出的方法

  • 构建多个使用不同核函数的高斯过程集成模型,并为各组件分配随已标注数据逐步演化而更新的自适应权重。
  • 利用贝叶斯模型平均法,根据每个GP组件在当前已标注数据集下的似然值,更新EGP权重。
  • 设计多种基于不确定性的采集函数(如方差)和基于分歧度的采集函数(如集成成员间预测方差)。
  • 通过在线优化学习各采集函数的动态权重,构建自适应多采集函数。
  • 在迭代式主动学习循环中应用EGP模型与自适应采集函数,每一步查询最具信息量的样本。
  • 通过负预测对数似然(NPLL)校准不确定性,并使用归一化均方根误差(NMSE)评估性能。

实验结果

研究问题

  • RQ1在数据稀缺条件下,通过自适应加权组件的高斯过程集成能否提升主动学习中的函数逼近性能?
  • RQ2与单GP基线相比,基于EGP的采集函数在预测准确性和不确定性量化方面的表现如何?
  • RQ3对多个采集函数进行自适应加权在多大程度上提升了在多样化数据集和任务中的鲁棒性?
  • RQ4在真实世界中医疗和机器人回归任务中,EGP-multiAF方法在标注数据有限的条件下是否仍保持优异性能?
  • RQ5EGP框架能否在无需完整重训练的前提下,有效捕捉逐步标注数据中的复杂非线性关系?

主要发现

  • 在疟疾和糖尿病数据集上,EGP-multiAF方法实现了最低的归一化均方根误差(NMSE),优于GP-Var基线。
  • 在加州房价数据集上,EGP-multiAF实现了最佳的负预测对数似然(NPLL),表明其不确定性校准能力更优。
  • 在机器人推动物体任务(3D与4D)中,所有基于EGP的方法均显著降低了NMSE与NPLL,且EGP-multiAF始终表现最佳。
  • 尽管单GP方法在疟疾病例上表现尚可,但所有基于EGP的方法仍优于GP-Var基线,证明其在不确定性量化方面更具优势。
  • 自适应采集函数集成方法始终优于静态或非自适应组合,证明在线权重调整具有显著价值。
  • EGP模型通过权重自适应动态选择最相关核函数,从而在所有测试场景中提升了函数空间的表达能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。