Skip to main content
QUICK REVIEW

[论文解读] Diversity Enhanced Active Learning with Strictly Proper Scoring Rules

Wei Tan, Lan Du|arXiv (Cornell University)|Oct 27, 2021
Machine Learning and Algorithms被引用 5
一句话总结

该论文提出了一种新型主动学习框架——贝叶斯均值正确评分估计(BEMPS),该框架采用严格 proper scoring rules(如对数概率和均方误差)来改进文本分类中的不确定性估计。通过用基于评分的获取函数替代传统的基于误差的获取函数,BEMPS实现了更校准的不确定性估计,并在多个数据集上持续优于WMOCU、BADGE和BALD,尤其是在结合多样性感知的批量选择策略和动态验证集集成时表现更优。

ABSTRACT

We study acquisition functions for active learning (AL) for text classification. The Expected Loss Reduction (ELR) method focuses on a Bayesian estimate of the reduction in classification error, recently updated with Mean Objective Cost of Uncertainty (MOCU). We convert the ELR framework to estimate the increase in (strictly proper) scores like log probability or negative mean square error, which we call Bayesian Estimate of Mean Proper Scores (BEMPS). We also prove convergence results borrowing techniques used with MOCU. In order to allow better experimentation with the new acquisition functions, we develop a complementary batch AL algorithm, which encourages diversity in the vector of expected changes in scores for unlabelled data. To allow high performance text classifiers, we combine ensembling and dynamic validation set construction on pretrained language models. Extensive experimental evaluation then explores how these different acquisition functions perform. The results show that the use of mean square error and log probability with BEMPS yields robust acquisition functions, which consistently outperform the others tested.

研究动机与目标

  • 通过用严格 proper scoring rules 替代分类误差,解决基于误差的获取函数在主动学习中的局限性。
  • 开发一个理论基础坚实的贝叶斯框架(BEMPS),用于估计对数概率和均方误差等正确评分的期望提升。
  • 通过基于向量的期望评分变化表示和聚类方法,将多样性整合到批量主动学习中。
  • 通过在微调后的Transformer模型上实施动态验证集构建和集成学习,提升模型性能。
  • 在符合实际约束(如医学等领域)的有限标注预算下评估所提方法。

提出的方法

  • 基于严格 proper scoring rules(如对数概率、均方误差)的期望评分提升来构建获取函数,而非基于分类误差。
  • 使用贝叶斯估计计算未标注样本的期望评分提升,构成 BEMPS 获取函数的核心。
  • 提出一种批量主动学习策略,基于其期望评分变化向量(公式6)对未标注样本进行聚类,以促进多样性。
  • 对 DistilBERT 嵌入的期望评分变化应用 k-means 聚类,以选择多样且高不确定性的样本。
  • 实施一种动态验证集策略,在每次主动学习迭代后重新采样验证数据,以提升集成模型的泛化能力。
  • 结合模型集成与动态验证集,提升不确定性估计与模型校准性,而无需依赖大规模固定验证集。

实验结果

研究问题

  • RQ1对数概率和均方误差等严格 proper scoring rules 是否可作为主动学习获取函数中分类误差的更鲁棒、更校准的替代方案?
  • RQ2基于期望正确评分提升的 BEMPS 框架,在文本分类中与 BALD 和 WMOCU 等现有基于不确定性的获取函数相比表现如何?
  • RQ3通过期望评分变化的聚类实现批量选择中的多样性,能在多大程度上提升主动学习性能?
  • RQ4动态验证集构建在深度神经网络的主动学习中,如何提升模型性能与不确定性估计?
  • RQ5在现实标注预算约束下,BEMPS、多样性感知批量选择与动态验证集集成的组合是否能持续优于最先进基线方法?

主要发现

  • 在 BEMPS 中使用均方误差和对数概率作为评分规则,生成的获取函数(CoreMSE 和 CoreLog)在四个文本分类数据集上持续优于 WMOCU、BADGE 和 BALD。
  • 结合通过期望评分变化聚类实现多样性促进的批量 BEMPS 策略(CoreMSE 和 CoreLog),显著优于非多样性变体(CoreMSE_top 和 CoreLog_top),证明了批量选择中多样性的重要性。
  • 动态验证集构建在 PubMed 和 SST-5 数据集上,自第三次获取迭代后,性能优于固定长度或无验证集基线。
  • BEMPS 与动态验证集及集成的结合,即使在小标注预算下,也能提升模型校准性与泛化能力。
  • 所提方法无需依赖半监督学习,因此与纯粹监督的主动学习基线相比更具公平性。
  • CoreMSE 和 CoreLog 在不同数据集和模型架构上均表现出鲁棒性,表明其在专家标注受限的真实世界文本分类任务中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。