[论文解读] Cold-start Active Learning through Self-supervised Language Modeling
本文提出 ALPS(通过处理惊奇度进行主动学习),一种针对基于 BERT 的文本分类的冷启动主动学习方法,该方法使用掩码语言建模(MLM)损失作为不确定性的代理。通过选择困惑度较高的样本(表明在预训练模型下可能性较低),ALPS 在更少的标注迭代次数和更少的计算量下实现了比基线方法更高的准确率,展示了在低数据设置下的强大效率和有效性。
Active learning strives to reduce annotation costs by choosing the most critical examples to label. Typically, the active learning strategy is contingent on the classification model. For instance, uncertainty sampling depends on poorly calibrated model confidence scores. In the cold-start setting, active learning is impractical because of model instability and data scarcity. Fortunately, modern NLP provides an additional source of information: pre-trained language models. The pre-training loss can find examples that surprise the model and should be labeled for efficient fine-tuning. Therefore, we treat the language modeling loss as a proxy for classification uncertainty. With BERT, we develop a simple strategy based on the masked language modeling loss that minimizes labeling costs for text classification. Compared to other baselines, our approach reaches higher accuracy within less sampling iterations and computation time.
研究动机与目标
- 解决在模型未校准且数据稀缺的低资源设置下的主动学习挑战。
- 开发一种不依赖分类置信度分数或微调模型的冷启动主动学习策略。
- 利用预训练语言模型的自监督目标作为数据选择中不确定性的代理。
- 在最小标注工作量下提升算法效率和模型准确率。
- 实现灵活的采样策略,包括批量查询,而无需重新训练分类器。
提出的方法
- ALPS 使用预训练 BERT 编码器的掩码语言建模(MLM)损失作为分类不确定性的代理。
- 它选择 MLM 困惑度最高的未标注样本,假设这些样本更具出人意料性,因此对微调更具信息量。
- 该方法在冷启动设置下运行,仅依赖预训练模型的自监督机制,无需初始微调或置信度分数。
- ALPS 支持迭代式和单批采样策略,可在不同标注预算下灵活部署。
- 该算法应用于标准的主动学习循环:查询高惊奇度样本,标注它们,并微调分类器。
- 该方法在四个文本分类数据集上进行评估,并与多种主动学习基线方法进行比较。
实验结果
研究问题
- RQ1自监督语言建模损失能否在冷启动主动学习中有效充当不确定性的代理?
- RQ2ALPS 在准确率和标注效率方面与传统主动学习方法相比表现如何?
- RQ3ALPS 在一次性采样大批量数据时是否能保持性能,而无需重新训练分类器?
- RQ4在低资源文本分类场景中,使用预训练模型的困惑度是否能改善数据选择?
- RQ5与基线方法相比,ALPS 在多大程度上减少了标注迭代次数和计算成本?
主要发现
- ALPS 在四个文本分类数据集(包括 PubMed 和 IMDB)上均实现了比基线主动学习方法更高的测试准确率。
- 该方法达到峰值性能所需的标注迭代次数更少,表现出更优的样本效率。
- ALPS 通过仅依赖预训练编码器,避免了每次查询后重复的模型微调,从而显著减少计算时间。
- 无论采用迭代采样还是单批采样,该算法均保持一致的性能,显示出部署上的灵活性。
- 在 PubMed 上使用 ALPS 采样 1,000 个句子仅需约 97 分钟,在 IMDB 上仅需约 7 分钟,表明其具有很高的可扩展性。
- 将 MLM 困惑度作为选择标准的表现优于基于模型置信度的不确定性采样,尤其在冷启动场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。