[论文解读] Zero-Shot Text Classification with Self-Training
本文提出一种即插即用的自训练方法,仅使用类别名称和无标签数据集,无需标注数据或领域专业知识,即可提升零样本文本分类性能。通过在自身高置信度预测上微调预训练的自然语言蕴涵模型,该方法在多种文本分类任务中实现了显著的性能提升,证明了自训练能有效将通用型零样本模型适配到特定下游任务。
Recent advances in large pretrained language models have increased attention to zero-shot text classification. In particular, models finetuned on natural language inference datasets have been widely adopted as zero-shot classifiers due to their promising results and off-the-shelf availability. However, the fact that such models are unfamiliar with the target task can lead to instability and performance issues. We propose a plug-and-play method to bridge this gap using a simple self-training approach, requiring only the class names along with an unlabeled dataset, and without the need for domain expertise or trial and error. We show that fine-tuning the zero-shot classifier on its most confident predictions leads to significant performance gains across a wide range of text classification tasks, presumably since self-training adapts the zero-shot model to the task at hand.
研究动机与目标
- 为解决通用型零样本文本分类器的性能局限问题,这些分类器常因缺乏任务特定适应而表现不如监督模型。
- 探究自训练是否能仅使用无标签数据和类别名称,有效将现成的零样本模型适配到下游任务。
- 提供一种实用、即插即用的方法,仅需极少工作量且无需标注数据,使从业者能以最小干预提升模型性能。
- 评估自训练在多种文本分类基准上适配基于蕴涵的零样本分类器的有效性。
- 探究自训练是否能通过使模型适应任务特定特征,弥合预训练模型与下游任务之间的分布差距。
提出的方法
- 通过将每个输入文本与包含类别名称的假设模板(如 'This text is about [class]')结合,使用预训练的自然语言蕴涵(NLI)模型作为零样本分类器,生成蕴涵分数。
- 模型对无标签数据集进行预测,并选择置信度最高的k个样本,置信度定义为最高分与第二高分之间的差值。
- 将这些高置信度预测结果视为伪标签,并用于在自训练循环中微调原始零样本模型。
- 该过程为迭代式:模型基于自身生成的伪标签数据重新训练,逐步适应目标任务的分布和语言模式。
- 基于置信度的样本选择确保仅使用最可靠的预测进行再训练,从而减少不确定预测带来的噪声。
- 该方法即插即用,仅需类别名称和无标签数据集——无需额外超参数调优或领域特定知识。
实验结果
研究问题
- RQ1自训练是否能在不使用目标任务标注数据的情况下,显著提升即插即用的零样本文本分类器性能?
- RQ2自训练是否能有效将通用型零样本模型适配到特定下游任务的语言和分布特征?
- RQ3在零样本设置下,自训练达到有意义性能提升需要多少无标签数据?
- RQ4当无标签数据来自不同但相关的领域或任务时,自训练是否仍能提升性能?
- RQ5在可扩展性和实际可用性方面,自训练与其它零样本适应技术相比表现如何?
主要发现
- 自训练在多种文本分类任务中均带来显著性能提升,且在AG News、20 Newsgroups和DBPedia等标准基准上均有可观测到的改进。
- 即使仅有10,000个无标签样本,该方法也能实现一致的性能增益,证明其高效性与实用性。
- 性能提升归因于模型对目标任务分布的适应,因为自训练有助于弥合预训练模型的一般知识与任务特定模式之间的差距。
- 跨任务自训练(即使用相关领域无标签数据)同样带来性能提升,表明该方法在相似任务间具有良好的泛化能力。
- 该方法在多种数据集上表现出鲁棒性与有效性,包括类别分布和文本长度各异的数据集,且无需针对任务调整超参数。
- 作者发布了代码与评估工具,支持结果复现,并推动零样本分类自训练的进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。