Skip to main content
QUICK REVIEW

[论文解读] Pre-trained Token-replaced Detection Model as Few-shot Learner

Zicheng Li, Shoushan Li|arXiv (Cornell University)|Mar 7, 2022
Natural Language Processing Techniques被引用 6
一句话总结

本文提出了一种新颖的少样本学习方法,利用预训练的标记替换检测模型(如 ELECTRA),通过将分类任务重新表述为标记替换检测问题,将标签描述词插入提示中。模型预测最不被替换(最原始)的标签词,从而在16个NLP数据集上实现最先进性能,优于基于掩码语言模型的少样本学习方法,涵盖单句和双句任务。

ABSTRACT

Pre-trained masked language models have demonstrated remarkable ability as few-shot learners. In this paper, as an alternative, we propose a novel approach to few-shot learning with pre-trained token-replaced detection models like ELECTRA. In this approach, we reformulate a classification or a regression task as a token-replaced detection problem. Specifically, we first define a template and label description words for each task and put them into the input to form a natural language prompt. Then, we employ the pre-trained token-replaced detection model to predict which label description word is the most original (i.e., least replaced) among all label description words in the prompt. A systematic evaluation on 16 datasets demonstrates that our approach outperforms few-shot learners with pre-trained masked language models in both one-sentence and two-sentence learning tasks.

研究动机与目标

  • 解决在自然语言处理中因标注数据有限而带来的低资源少样本学习挑战。
  • 探索预训练标记替换检测模型(如 ELECTRA)在少样本学习中被低估的潜力。
  • 通过将分类任务重新表述为标记替换检测问题,提升少样本学习性能。
  • 在多样化的单句和双句NLP任务中评估该方法的有效性。

提出的方法

  • 通过在提示中插入标签描述词,将下游分类或回归任务重新表述为标记替换检测问题。
  • 将模板和所有标签描述词插入输入句子,构成提示,有意引入潜在的标记替换。
  • 使用预训练的 ELECTRA 风格模型,预测所有候选中最为原始(被替换最少)的标签描述词。
  • 仅使用每类少量标注样本进行模型训练与评估,利用模型检测被替换标记的能力。
  • 设计不同模板和标签描述词的提示,以研究其对性能的影响。
  • 在固定超参数和标准化评估协议下,将该方法与基于掩码语言模型的少样本学习方法(如 LM-BFF)进行比较。

实验结果

研究问题

  • RQ1预训练的标记替换检测模型能否被有效重用于下游NLP任务的少样本学习?
  • RQ2在低资源设置下,该方法的性能与基于掩码语言模型的少样本学习方法相比如何?
  • RQ3不同提示模板和标签描述词对少样本学习准确率有何影响?
  • RQ4每类标注样本数量如何影响所提方法的性能?

主要发现

  • 在16个数据集中的15个上,该方法在单句和双句任务中均优于基于掩码语言模型的少样本学习方法(如 LM-BFF)。
  • 在 SST-2 数据集上,使用模板 'It was great terrible' 时,准确率达到 91.4%,超过 LM-BFF 的 88.6%。
  • 在 MNLI 上,当每类使用 128 至 512 个标注样本时,该方法优于 LM-BFF,显示出在中等样本设置下的更强泛化能力。
  • 标签描述词与任务类别之间的语义相似性显著提升性能,其中 'great/terrible' 和 'good/bad' 表现优于语义无关的组合如 'dog/cat'。
  • 模型对提示模板敏感,性能受标点符号和结构影响,但未发现通用最优模板。
  • 即使每类仅有 4 个标注样本,该方法仍保持强劲性能,展现出在极端低资源场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。