[论文解读] Zero-shot Learning by Generating Task-specific Adapters.
本文提出 Hypter,一种通过超网络从任务描述中生成轻量级、任务特定适配器的框架,以增强文本到文本转换器中的零样本学习。通过在任务级别而非实例级别进行学习,Hypter 在减少参数量的同时提升了零样本迁移能力,在两个数据集上优于微调基线模型。
Pre-trained text-to-text transformers achieve impressive performance across a wide range of NLP tasks, and they naturally support zero-shot learning (ZSL) by using the task description as prompt in the input. However, this approach has potential limitations, as it learns from input-output pairs at instance level, instead of learning to solve tasks at task level. Alternatively, applying existing ZSL methods to text-to-text transformers is non-trivial due to their text generation objective and huge size. To address these issues, we introduce Hypter, a framework that improves zero-shot transferability by training a hypernetwork to generate task-specific adapters from task descriptions. This formulation enables learning at task level, and greatly reduces the number of parameters by using light-weight adapters. Experiments on two datasets demonstrate Hypter improves upon fine-tuning baselines.
研究动机与目标
- 为解决现有零样本学习方法在文本到文本转换器中的局限性,这些方法在实例级别而非任务级别从输入-输出对中学习。
- 在不进行微调的情况下,实现大规模预训练模型的有效零样本迁移能力,尽管其文本生成目标和高参数量。
- 通过从任务描述中生成轻量级适配器,减少零样本适应中的可训练参数数量。
- 通过使用超网络将适应形式化为任务级别的学习问题,提升零样本泛化能力。
提出的方法
- 训练一个超网络,根据任务的自然语言描述生成任务特定适配器。
- 适配器是轻量级、参数高效的模块,插入预训练转换器中以适应其行为以应对特定任务。
- 该框架通过将适配器生成条件化在任务描述上,而非从单个输入-输出示例中学习,实现任务级别适应。
- 超网络端到端训练,以生成在多样化任务中优化零样本性能的适配器。
- 该方法利用基础模型的文本生成目标,同时最小化对微调或大量参数更新的需求。
实验结果
研究问题
- RQ1超网络能否有效从自然语言任务描述中生成任务特定适配器,以提升零样本迁移能力?
- RQ2与在实例级别学习相比,在任务级别学习是否能带来文本到文本转换器中更好的零样本泛化能力?
- RQ3参数高效的适配器生成能否在保持或提升性能的同时减少可训练参数数量?
- RQ4在多样化 NLP 任务的零样本设置中,该方法与微调基线相比表现如何?
主要发现
- Hypter 通过在任务级别学习,提升了零样本迁移能力,实现了优于实例级别学习的泛化能力。
- 尽管无需任务特定微调,该框架在两个基准数据集上的表现优于微调基线。
- 使用轻量级适配器显著减少了可训练参数数量,提升了效率。
- 基于超网络的适配器生成方法在不修改基础模型权重的情况下实现了有效适应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。