[论文解读] Grad2Task: Improved Few-shot Text Classification Using Gradients for Task Representation
本文提出 Grad2Task,一种新颖的少样本文本分类方法,利用基础模型的梯度信息来表示任务,从而实现对微调后的 BERT 基分类器的高效适应。通过将适配器模块基于这些基于梯度的任务表示进行条件化,该方法在多种少样本文本分类任务中实现了最先进性能,优于传统的微调、顺序迁移学习和元学习基线方法。
Large pretrained language models (LMs) like BERT have improved performance in many disparate natural language processing (NLP) tasks. However, fine tuning such models requires a large number of training examples for each target task. Simultaneously, many realistic NLP problems are "few shot", without a sufficiently large training set. In this work, we propose a novel conditional neural process-based approach for few-shot text classification that learns to transfer from other diverse tasks with rich annotation. Our key idea is to represent each task using gradient information from a base model and to train an adaptation network that modulates a text classifier conditioned on the task representation. While previous task-aware few-shot learners represent tasks by input encoding, our novel task representation is more powerful, as the gradient captures input-output relationships of a task. Experimental results show that our approach outperforms traditional fine-tuning, sequential transfer learning, and state-of-the-art meta learning approaches on a collection of diverse few-shot tasks. We further conducted analysis and ablations to justify our design choices.
研究动机与目标
- 解决每类标注样本极有限的少样本文本分类挑战。
- 通过利用梯度信息作为比输入编码更具表现力的任务表示,提升少样本学习中的泛化能力。
- 实现从具有不同标签语义和结构的多样化源任务中有效迁移。
- 开发一种高效、参数高效的适应机制,利用预训练 BERT 模型中的适配器模块。
- 在少样本文本分类基准上超越现有的微调、顺序迁移学习和元学习方法。
提出的方法
- 使用在少样本支持集上损失相对于模型参数的完整梯度来构建任务表示,以捕捉输入-输出关系。
- 采用条件神经过程(CNAP)框架,其中适应网络根据基于梯度的任务嵌入调节适配器参数。
- 使用带有瓶颈适配器模块的预训练 BERT 作为特征提取器,以保持效率并实现参数共享。
- 将标签视为文本标记,并通过 BERT 编码以构成任务表示的一部分,与输入和梯度特征结合。
- 适应网络为适配器层生成缩放和偏移参数,实现在推理过程中快速、任务特定的适应。
- 使用支持集上的交叉熵损失进行端到端训练,基于梯度的任务特征用于条件化适应网络。
实验结果
研究问题
- RQ1基于梯度的少样本任务表示是否能超越基于输入的任务表示,提升少样本文本分类性能?
- RQ2将梯度信息作为任务嵌入是否能提升在多样化、结构不同的文本分类任务上的泛化能力?
- RQ3在少样本设置下,所提出方法与传统微调和最先进元学习方法相比表现如何?
- RQ4不同设计选择(如调节所有标记 vs. 仅 [CLS] 标记)对模型性能有何影响?
- RQ5在少样本设置下,基于超网络的参数生成方法是否优于所提出的适应机制?
主要发现
- Grad2Task 在 10 个多样化的少样本文本分类任务上实现了平均 45.83% 的准确率,优于传统微调和顺序迁移学习。
- 该方法显著超越最先进元学习基线(包括 CNAP),比次佳基线高出 1.2% 的绝对准确率。
- 使用基于梯度的任务表示优于单独使用输入编码或标签编码,消融实验表明,当用平均输入嵌入替代梯度时,准确率下降 1.5%。
- 仅调节 [CLS] 标记表示的性能更差(44.57%),相比适配所有标记,表明全序列适应的重要性。
- 基于超网络的参数生成方法达到 44.79% 的准确率,低于 Grad2Task,表明直接适配适配器参数更有效且更不易过拟合。
- 微调任务嵌入模型可达到 45.68% 的准确率,略低于所提方法,表明端到端训练在此设置下更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。