Skip to main content
QUICK REVIEW

[论文解读] Integrating Informativeness, Representativeness and Diversity in Pool-Based Sequential Active Learning for Regression

Ziang Liu, Dongrui Wu|arXiv (Cornell University)|Mar 26, 2020
Machine Learning and Algorithms参考文献 17被引用 4
一句话总结

本论文提出了三种新型基于池的序列主动学习回归(ALR)方法,通过将过程解耦为无监督初始化与有监督迭代两个阶段,联合优化信息性、代表性与多样性。表现最佳的方法RDiGSr在使用L2正则化的岭回归模型下,于12个多样化数据集上显著优于当前最先进方法,实现了最低的平均RMSE与最高的相关系数。

ABSTRACT

In many real-world machine learning applications, unlabeled samples are easy to obtain, but it is expensive and/or time-consuming to label them. Active learning is a common approach for reducing this data labeling effort. It optimally selects the best few samples to label, so that a better machine learning model can be trained from the same number of labeled samples. This paper considers active learning for regression (ALR) problems. Three essential criteria -- informativeness, representativeness, and diversity -- have been proposed for ALR. However, very few approaches in the literature have considered all three of them simultaneously. We propose three new ALR approaches, with different strategies for integrating the three criteria. Extensive experiments on 12 datasets in various domains demonstrated their effectiveness.

研究动机与目标

  • 解决现实应用中回归数据标注成本高昂的问题,其中未标注数据丰富但标注代价昂贵。
  • 开发一个统一框架,同时优化基于池的序列主动学习回归中的三个关键标准——信息性、代表性与多样性样本选择。
  • 通过将代表性与多样性(通过RD和iGS)与信息性(通过EMCM或QBC)以合理方式整合,提升模型性能。
  • 在多样化回归数据集上评估所提方法,并建立与现有最先进方法相比性能提升的统计显著性。

提出的方法

  • 将主动学习分解为两个阶段:仅使用代表性与多样性进行无监督初始化阶段,以及结合所有三个标准的有监督迭代阶段。
  • 通过将代表性-多样性(RD)方法与改进的贪心采样(iGS)及期望模型变化最大化(EMCM)相结合,提出三种集成策略——RD-iGS、RDiGS与RDiGSr。
  • 以带L2正则化(r = 0.01, 0.001, 0.1)的岭回归作为基础回归模型,超参数在实验中进行调优。
  • 在迭代阶段采用贪心采样策略,每次新样本的选择基于信息性(模型方差)、代表性(局部密度)与多样性(与已选样本的距离)的加权组合。
  • 使用随机采样(RS)作为基线,对RMSE与CC性能指标在数据集间进行归一化,并计算归一化AUC以实现公平比较。
  • 在α = 0.05水平下应用两样本单尾t检验,验证所提方法与基线方法之间性能差异的统计显著性。

实验结果

研究问题

  • RQ1将代表性与多样性(RD)与信息性(通过EMCM或QBC)相结合,是否能实现优于现有最先进ALR方法的回归模型性能?
  • RQ2将主动学习过程划分为无监督初始化与有监督迭代两个阶段,是否能提升样本选择质量与模型泛化能力?
  • RQ3RD与iGS的不同集成策略如何影响回归任务中模型准确率(RMSE)与相关系数(CC)之间的权衡?
  • RQ4所提方法对岭回归正则化系数变化(r = 0.001, 0.01, 0.1)是否具有鲁棒性?

主要发现

  • RDiGSr在全部12个数据集上实现了最低的平均RMSE,其RMSE归一化AUC相比随机采样(RS)平均提升17.0%,优于所有其他方法。
  • RDiGSr在CC上相比RS有7.0%的平均提升,且t检验中归一化AUC为1.0000,表明其相关系数性能显著更优。
  • RDiGSr在RMSE与CC上均显著优于RD-EMCM与iGS,p值分别为0.0000与0.0010,证实其性能更优。
  • 该方法在不同正则化系数(r = 0.001与r = 0.1)下均保持鲁棒,RMSE与CC方面持续优于RD-EMCM与iGS。
  • RDiGSr的RMSE低于RDiGS(p = 0.0690),且CC显著更高(p = 0.0001),表明在迭代阶段使用iGSr优于iGS。
  • 所提三种方法——RDiGS、RDiGSr与RD-iGS——在性能上均优于或等同于最先进方法RD-EMCM与iGS,其中RDiGSr整体表现最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。