[论文解读] Active Learning for Regression Using Greedy Sampling
本论文提出了两种新颖的回归主动学习(ALR)方法——GSx(输入空间中的贪心采样)和iGS(输入与输出空间中的贪心采样),通过在特征空间和输出空间中基于多样性选择信息丰富的样本,无需模型微调。iGS在12个UCI/StatLib数据集和15名基于EEG的驾驶员困倦度估计受试者中均优于现有方法,显著提升了均方根误差(RMSE)和皮尔逊相关系数(CC)。
Regression problems are pervasive in real-world applications. Generally a substantial amount of labeled samples are needed to build a regression model with good generalization ability. However, many times it is relatively easy to collect a large number of unlabeled samples, but time-consuming or expensive to label them. Active learning for regression (ALR) is a methodology to reduce the number of labeled samples, by selecting the most beneficial ones to label, instead of random selection. This paper proposes two new ALR approaches based on greedy sampling (GS). The first approach (GSy) selects new samples to increase the diversity in the output space, and the second (iGS) selects new samples to increase the diversity in both input and output spaces. Extensive experiments on 12 UCI and CMU StatLib datasets from various domains, and on 15 subjects on EEG-based driver drowsiness estimation, verified their effectiveness and robustness.
研究动机与目标
- 通过减少所需标注样本数量,降低回归任务中的高标注成本。
- 克服现有ALR方法依赖模型微调或难以有效捕捉样本多样性的局限。
- 开发一种计算高效、与模型无关的ALR方法,以最小标注数据实现更好的泛化性能。
- 在多样化的回归任务上评估所提方法,包括UCI/StatLib数据集和真实世界中的基于EEG的驾驶员困倦度估计。
- 证明在样本选择中结合输入与输出空间多样性能显著提升回归精度。
提出的方法
- 提出GSx,一种贪心采样方法:首先选择与未标注样本池中心最接近的样本,随后迭代选择与已选样本在输入(特征)空间中距离最远的样本。
- 提出GSy,其在GSx基础上扩展,通过最大化未标注样本与已选样本在输出(目标值)空间中的多样性来选择样本,多样性通过未标注样本预测输出与已选样本预测输出之间的距离计算。
- 提出iGS,一种混合方法,通过计算同时考虑特征空间与输出空间分离的复合距离度量,结合输入与输出空间的多样性。
- 采用欧氏距离衡量多样性:对于GSx,$ d_n^x = \min_m ||\mathbf{x}_n - \mathbf{x}_m|| $;对于GSy,$ d_n^y = \min_m ||\hat{y}_n - \hat{y}_m|| $;对于iGS,采用两者的加权组合。
- 采用顺序池式主动学习框架,样本在不重新训练回归模型的前提下逐轮选择,确保计算成本低。
- 在岭回归作为基础模型的回归任务中应用该方法,性能通过RMSE和皮尔逊相关系数(CC)评估。
实验结果
研究问题
- RQ1基于输入空间多样性的贪心采样(GSx)是否能相比随机采样或不确定性采样,提升回归主动学习的性能?
- RQ2引入输出空间多样性(GSy)是否能带来优于仅基于输入空间多样性的回归性能?
- RQ3结合输入与输出空间多样性(iGS)是否能在多种回归任务中实现更优性能?
- RQ4所提iGS方法与现有ALR基线方法(如QBC、EMCM)相比,在多个数据集上的鲁棒性与泛化能力如何?
- RQ5所提方法在真实世界高成本标注场景(如基于EEG的驾驶员困倦度估计)中是否有效?
主要发现
- 在15名EEG驱动的困倦度估计受试者中,iGS在RMSE和CC指标上均优于BL、QBC、EMCM、GSx和GSy,平均性能最佳。
- iGS在RMSE上相比所有其他方法均具有统计显著性提升(p < 0.001),在CC上除GSx外也具有显著性提升(p = 0.0394),证实其鲁棒性与优越性。
- GSx在RMSE和CC上显著优于QBC和EMCM,验证了在回归主动学习中输入空间多样性方法的有效性。
- GSy在RMSE上相比QBC和EMCM具有统计显著性提升,相比GSx也具有提升趋势(p = 0.0955),表明输出空间多样性可增强性能。
- 在12个UCI和CMU StatLib数据集中,iGS始终排名第一,GSy和GSx也优于基线方法。
- 统计分析证实,所有所提ALR方法相比基线(BL)均显著降低RMSE并提升CC,证明其在多样化回归任务中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。