Skip to main content
QUICK REVIEW

[论文解读] Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference

Timo Schick, Hinrich Schütze|arXiv (Cornell University)|Jan 21, 2020
Topic Modeling被引用 15
一句话总结

本文提出Pattern-Exploiting Training(PET),一种半监督方法,将少样本文本分类和自然语言推理任务重新表述为基于自然语言模式的完形填空式问题,并使用verbalizers(表述器)进行映射。通过在这些模式上微调预训练语言模型,PET为大规模未标注数据集生成软标签,随后利用这些软标签训练最终分类器——在多种语言和任务的低资源设置下实现了最先进性能。

ABSTRACT

Some NLP tasks can be solved in a fully unsupervised fashion by providing a pretrained language model with "task descriptions" in natural language (e.g., Radford et al., 2019). While this approach underperforms its supervised counterpart, we show in this work that the two ideas can be combined: We introduce Pattern-Exploiting Training (PET), a semi-supervised training procedure that reformulates input examples as cloze-style phrases to help language models understand a given task. These phrases are then used to assign soft labels to a large set of unlabeled examples. Finally, standard supervised training is performed on the resulting training set. For several tasks and languages, PET outperforms supervised training and strong semi-supervised approaches in low-resource settings by a large margin.

研究动机与目标

  • 解决因标注数据有限导致的少样本NLP任务性能不佳的问题。
  • 通过引入任务描述,克服仅凭少数标注样本难以泛化的问题。
  • 开发一种利用预训练语言模型有效利用未标注数据的半监督方法。
  • 通过结合监督微调与来自预训练语言模型的基于模式的知识蒸馏,提升少样本学习性能。

提出的方法

  • 定义多种完形填空式模式(例如,'这是我吃过的最好的披萨。它是____')以表达任务语义。
  • 使用verbalizers将类别标签映射为合理的填空补全结果(例如,'great' → '1','bad' → '-1')。
  • 使用少量标注数据集,在每个模式-verbalizer对上微调预训练语言模型。
  • 集成微调后的模型,对大规模未标注数据集预测软标签。
  • 使用标准监督学习在软标签数据集上训练最终分类器。
  • 提出iPET,一种迭代变体,通过多代逐步增加训练集规模。

实验结果

研究问题

  • RQ1当与监督微调结合时,完形填空式模式是否能提升少样本文本分类与自然语言推理任务的性能?
  • RQ2在低资源设置下,PET与监督训练及强基线半监督方法相比表现如何?
  • RQ3迭代优化过程(iPET)是否能在多代中持续带来性能提升?
  • RQ4PET的性能提升在多大程度上源于未标注数据,而非基于模式的知识蒸馏?
  • RQ5PET对模式选择是否敏感?集成或蒸馏能否缓解表现较差模式的影响?

主要发现

  • PET在少样本文本分类与自然语言推理任务上显著优于标准监督微调和强基线半监督方法。
  • 在10个样本的训练集下,PET在AG's News上的平均准确率达到85.6%,在Yelp上的准确率为83.2%,较监督基线高出10多个百分点。
  • 迭代变体iPET在所有代次中均提升性能,最终模型在四代训练后于AG's News上达到88.1%的准确率。
  • 知识蒸馏在减小最终分类器大小的同时提升了准确率,表明软标签比单个模型生成的硬标签更有效。
  • 即使仅使用单一模式,PET的性能仍优于表现最好的单个模式,证明集成学习可缓解特定模式的弱点。
  • 领域内预训练无法完全解释PET的性能增益,因为即使在两者均在相同领域数据上微调的情况下,PET仍优于监督模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。