[论文解读] Uncertainty-based Query Strategies for Active Learning with Transformers.
本文提出了基于不确定性的查询策略,用于基于变换器的主动学习,证明这些策略仅使用0.4%至15%的训练数据,即可在五个文本分类基准上实现SOTA性能,学习曲线下面积提升最高达14.4个百分点。
Active learning is the iterative construction of a classification model through targeted labeling, enabling significant labeling cost savings. As most research on active learning has been carried out before transformer-based language models (transformers) became popular, despite its practical importance, comparably few papers have investigated how transformers can be combined with active learning to date. This can be attributed to the fact that using state-of-the-art query strategies for transformers induces a prohibitive runtime overhead, which effectively cancels out, or even outweighs aforementioned cost savings. In this paper, we revisit uncertainty-based query strategies, which had been largely outperformed before, but are particularly suited in the context of fine-tuning transformers. In an extensive evaluation on five widely used text classification benchmarks, we show that considerable improvements of up to 14.4 percentage points in area under the learning curve are achieved, as well as a final accuracy close to the state of the art for all but one benchmark, using only between 0.4% and 15% of the training data.
研究动机与目标
- 解决由于运行时开销高,导致将最先进变换器与主动学习结合的研究不足的问题。
- 在微调后的变换器背景下,重新评估基于不确定性的查询策略,尽管其具备显著的效率增益潜力,但目前仍被低估。
- 证明当应用于微调后的变换器时,基于不确定性的策略可实现高模型性能,同时显著减少标注工作量。
- 在多样且广泛使用的文本分类基准上评估所提方法,以验证其泛化能力和鲁棒性。
提出的方法
- 将传统机器学习中常用的基于不确定性的查询策略,适配用于微调后的变换器模型。
- 利用模型的不确定度估计(如熵或基于间隔的不确定度)来选择最具信息量的样本进行标注。
- 在迭代式主动学习循环中集成不确定度采样,每次标注轮次后重新训练模型。
- 将该策略应用于微调后的BERT类模型在文本分类任务上,最大限度减少查询选择过程中的计算开销。
- 通过避免在每次迭代中重新计算所有样本的不确定度分数,优化推理效率。
- 在每次查询后使用标准微调流程更新模型,保持与现有NLP流水线的兼容性。
实验结果
研究问题
- RQ1当应用于微调后的变换器模型时,基于不确定性的查询策略是否能实现具有竞争力的主动学习性能?
- RQ2在基于变换器的文本分类背景下,基于不确定性的主动学习性能与其它查询策略相比如何?
- RQ3基于不确定性的策略在多大程度上能降低标注成本,同时在标准基准上保持高模型准确率?
- RQ4在仅使用少量标注数据的情况下,查询策略的选择对学习曲线和最终模型准确率有何影响?
主要发现
- 在五个文本分类基准上,基于不确定性的查询策略相比先前方法,学习曲线下面积最高提升14.4个百分点。
- 所提方法在除一个基准外的所有基准上均达到接近SOTA的最终准确率,且仅使用0.4%至15%的训练数据。
- 该方法有效缓解了基于变换器的主动学习中通常存在的运行时开销,实现了实际部署的可行性。
- 性能增益在多种不同的文本分类任务中保持一致,表明其具有广泛适用性和鲁棒性。
- 结果表明,当适配得当时,不确定度采样在微调后的变换器上表现极佳,此前曾被其他策略超越。
- 该方法在不牺牲模型性能的前提下,实现了显著的标注成本节约,适用于现实世界中的NLP应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。