[论文解读] PERFECT: Prompt-free and Efficient Few-shot Learning with Language Models
该论文提出 Perfect,一种无需提示(prompt-free)且高效的 few-shot 学习方法,用于微调预训练语言模型(PLMs),消除了对手动设计提示和词化器(verbalizers)的需求。通过使用特定任务的适配器(adapters)和可学习的多标记标签嵌入(multi-token label embeddings),Perfect 在仅使用 32 个样本的情况下,于 12 个 NLP 基准测试中达到最先进性能,同时相比先前方法将训练时间减少高达 100 倍,存储成本降低 100 倍。
Current methods for few-shot fine-tuning of pretrained masked language models (PLMs) require carefully engineered prompts and verbalizers for each new task to convert examples into a cloze-format that the PLM can score. In this work, we propose PERFECT, a simple and efficient method for few-shot fine-tuning of PLMs without relying on any such handcrafting, which is highly effective given as few as 32 data points. PERFECT makes two key design choices: First, we show that manually engineered task prompts can be replaced with task-specific adapters that enable sample-efficient fine-tuning and reduce memory and storage costs by roughly factors of 5 and 100, respectively. Second, instead of using handcrafted verbalizers, we learn new multi-token label embeddings during fine-tuning, which are not tied to the model vocabulary and which allow us to avoid complex auto-regressive decoding. These embeddings are not only learnable from limited data but also enable nearly 100x faster training and inference. Experiments on a wide range of few-shot NLP tasks demonstrate that PERFECT, while being simple and efficient, also outperforms existing state-of-the-art few-shot learning methods. Our code is publicly available at https://github.com/facebookresearch/perfect.git.
研究动机与目标
- 消除在预训练语言模型 few-shot 微调中对手动设计提示和词化器工程的需求。
- 在仅使用 32 个样本的低资源设置下,提升样本效率和训练稳定性。
- 相比基于提示的微调方法,降低内存、存储和推理成本。
- 开发一种简单、可泛化的框架,优于现有的基于提示和适配器的 few-shot 学习方法。
- 证明无需特定任务提示或词化,也能实现高效的 few-shot 学习。
提出的方法
- 用插入到 Transformer 架构中的特定任务适配器层替代手工设计的提示,冻结主 PLM 权重,仅微调适配器。
- 为每个类别引入一种可学习的、多标记的、固定长度的标签嵌入,该嵌入独立于模型词汇表,并在微调过程中端到端训练。
- 通过多个标记上的原型网络计算 logits,无需自回归解码,从而实现更快的推理。
- 采用掩码语言建模范式,结合动态掩码标记插入,其中掩码数量根据任务进行调优以获得最佳性能。
- 在标签嵌入上应用对比学习目标,以提升低样本设置下的泛化能力。
- 使用一个小的验证集(16 个样本)来调整超参数,符合 few-shot 学习设置。
实验结果
研究问题
- RQ1能否在无需手工设计提示和词化器的情况下实现 PLM 的 few-shot 学习?
- RQ2特定任务的适配器是否能实现样本高效微调,同时降低内存和存储成本?
- RQ3可学习的多标记标签嵌入是否在低样本设置下优于手动设计的词化器?
- RQ4消除标签预测的自回归解码是否能带来显著的速度提升而不损失性能?
- RQ5一种无需提示的、基于适配器的方法是否能在多样化的 few-shot NLP 基准上达到最先进性能?
主要发现
- Perfect 在 12 个多样化的 NLP 基准上均达到最先进性能,优于现有基于提示的方法。
- 在 SST-2 数据集上,Perfect 使用 32 个样本的 few-shot 学习达到 90.7% 的测试准确率,相比无适配器的基线模型高出 2.5 个百分点。
- 使用 Perfect 进行训练的速度相比需要自回归解码的方法最高可提升 100 倍,存储成本降低 100 倍。
- 该方法显著降低了在不同 few-shot 训练集上的性能方差,并提升了最差情况下的准确率,表明具有更高的稳定性。
- 适配器的使用显著减少了可训练参数数量,从而在低数据环境下实现更好的样本效率和更优的收敛性。
- 最优掩码数量因任务而异,其中两个掩码在大多数任务上表现最佳,但某些任务(如 MRPC)从更多掩码中受益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。