Skip to main content
QUICK REVIEW

[论文解读] Few-shot Sequence Learning with Transformers

Lajanugen Logeswaran, Ann Lee|arXiv (Cornell University)|Dec 17, 2020
Domain Adaptation and Few-Shot Learning参考文献 32被引用 5
一句话总结

本文提出任务自适应记忆(Task-Adaptive Memory, TAM),一种用于序列建模的简单而高效的少样本学习方法,基于Transformer架构。通过使用一阶梯度下降优化特定任务的嵌入向量,而非二阶方法,TAM在性能上可与元学习基线方法(如CAVIA和MAML)相媲美或更优,同时在计算效率上显著提升,尤其在离散序列的低样本设置下表现突出。

ABSTRACT

Few-shot algorithms aim at learning new tasks provided only a handful of training examples. In this work we investigate few-shot learning in the setting where the data points are sequences of tokens and propose an efficient learning algorithm based on Transformers. In the simplest setting, we append a token to an input sequence which represents the particular task to be undertaken, and show that the embedding of this token can be optimized on the fly given few labeled examples. Our approach does not require complicated changes to the model architecture such as adapter layers nor computing second order derivatives as is currently popular in the meta-learning and few-shot learning literature. We demonstrate our approach on a variety of tasks, and analyze the generalization properties of several model variants and baseline approaches. In particular, we show that compositional task descriptors can improve performance. Experiments show that our approach works at least as well as other methods, while being more computationally efficient.

研究动机与目标

  • 为解决自然语言处理与强化学习中每项任务仅有少量标注样本的少样本序列学习挑战。
  • 开发一种方法,使预训练的Transformer模型能够无需架构修改或复杂元学习组件,高效适应新任务。
  • 证明一阶优化任务嵌入可达到或超越MAML与CAVIA等二阶元学习方法的性能。
  • 评估通过任务嵌入实现的组合式任务描述与输入条件化在提升多样化序列任务泛化能力方面的有效性。

提出的方法

  • 该方法引入一个任务嵌入向量 z,将其附加到输入序列作为条件提示,使模型在不改变共享参数的情况下适应新任务。
  • 在推理或微调过程中,仅使用每项任务的少量标注样本,通过一阶梯度下降优化任务嵌入 z,避免使用二阶导数。
  • 对于序列分类任务,使用带有分类头的Transformer编码器,其中 [CLS] 标记被任务嵌入 z 替代。
  • 对于序列转换任务,使用Transformer解码器,并基于输入 x 和任务嵌入 z 条件计算输出序列的对数似然。
  • 训练过程交替更新共享模型参数 θ 与通过梯度下降优化任务嵌入 z,形成交替最小化方案。
  • 通过组合多个任务嵌入向量,探索组合式任务描述以表示复杂或分层的任务。

实验结果

研究问题

  • RQ1一阶优化任务嵌入是否可在无需二阶导数或架构适配器的情况下,实现与现有少样本序列建模任务相竞争的性能?
  • RQ2通过任务嵌入实现的输入条件化在准确率与效率方面,相较于其他少样本适应机制表现如何?
  • RQ3组合式任务描述是否能提升少样本序列学习中的泛化能力?
  • RQ4所提出方法在少样本示例数量(k)和每项任务的训练数据量方面如何扩展?
  • RQ5该方法是否能以极少的架构修改,有效应用于序列分类与序列转换任务?

主要发现

  • TAM在合成序列分类与转换基准上达到最先进性能,准确率超越MAML,与CAVIA持平或更优,同时计算效率显著更高。
  • 在路径查找任务中,TAM以2.7小时训练时间实现1.3的困惑度,而CAVIA耗时3.7小时达到1.5的困惑度,展现出更高的效率。
  • 该方法始终优于多任务基线(准确率为67.4%,困惑度为7.2),表明任务特定适应对少样本性能至关重要。
  • 消融研究显示,组合式任务描述通过使模型能够泛化到结构化任务变体,从而提升性能。
  • 基于Transformer的TAM模型在准确率与困惑度上均优于双向LSTM基线,证实该架构与方法结合的有效性。
  • 当每项任务拥有足够多的训练数据并进行多次内部循环更新时,任务嵌入的一阶优化已足够实现优异性能,挑战了‘二阶方法对良好少样本泛化必不可少’的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。