Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Learning with Siamese Networks and Label Tuning

Thomas Müller, Guillermo Pérez-Torró|arXiv (Cornell University)|Mar 28, 2022
Topic Modeling被引用 4
一句话总结

本文提出了一种基于孪生网络的少样本文本分类方法,采用标签微调(LT)仅微调标签嵌入,从而实现跨任务的高效、共享模型部署。尽管准确率略低于全参数微调,LT在显著降低推理成本的同时实现了接近最先进水平的性能,尤其在大规模标签集场景下表现出色,推理速度优于交叉注意力模型,并支持使用单一编码器进行多任务推理。

ABSTRACT

We study the problem of building text classifiers with little or no training data, commonly known as zero and few-shot text classification. In recent years, an approach based on neural textual entailment models has been found to give strong results on a diverse range of tasks. In this work, we show that with proper pre-training, Siamese Networks that embed texts and labels offer a competitive alternative. These models allow for a large reduction in inference cost: constant in the number of labels rather than linear. Furthermore, we introduce label tuning, a simple and computationally efficient approach that allows to adapt the models in a few-shot setup by only changing the label embeddings. While giving lower performance than model fine-tuning, this approach has the architectural advantage that a single encoder can be shared by many different tasks.

研究动机与目标

  • 为解决低资源文本分类中标签数据极少的挑战,特别是在零样本和少样本学习设置下。
  • 探索孪生网络作为少样本文本分类中交叉注意力模型的有力替代方案。
  • 提出标签微调(LT)方法,仅微调标签嵌入,从而实现跨任务的模型共享。
  • 评估少样本学习中性能与推理效率之间的权衡。
  • 评估该方法在多样化任务、语言和标签配置下的鲁棒性。

提出的方法

  • 模型采用对称的孪生网络结构,使用共享的Transformer编码器将输入文本和标签文本嵌入到共享向量空间中。
  • 通过输入嵌入与标签嵌入之间的点积计算文本相似度,支持预先计算标签嵌入以实现高效推理。
  • 标签微调(LT)在微调过程中仅更新标签嵌入,冻结编码器权重,从而实现单个编码器在多任务中的共享部署。
  • 采用批量Softmax损失函数,优化输入与正确标签之间的相似度得分,同时将批次中的其他标签作为负样本。
  • 应用知识蒸馏以恢复LT带来的性能损失,使用训练集中最多10,000个未标注样本。
  • 该方法在多种语言和多样化文本分类任务(包括情感分析、情绪识别和评论分类)上进行了评估。

实验结果

研究问题

  • RQ1孪生网络结合标签微调在少样本文本分类中是否能与交叉注意力模型达到相当的性能?
  • RQ2标签微调是否能实现高效、可扩展的单编码器多任务部署?
  • RQ3在训练样本有限的情况下,标签微调与全参数微调的性能表现如何比较?
  • RQ4标签表述模式(如身份假设 vs. 描述性提示)对模型性能有何影响?
  • RQ5模型性能与推理速度如何随标签集大小、文本长度以及否定标记的存在而变化?

主要发现

  • 孪生网络结合标签微调在多种任务和语言的零样本与少样本设置下,性能与交叉注意力模型相当。
  • 标签微调将推理成本降低至与标签数量无关的常数时间,而交叉注意力模型的推理成本随标签集大小线性增长,因此在大规模标签集场景下,孪生网络显著更快。
  • 在8和64个训练样本下,知识蒸馏恢复了标签微调与全参数微调之间的大部分性能差距,尤其在小规模标签集上效果更明显。
  • 在短文本(≤44个token)上,孪生网络优于交叉注意力模型;而在长序列(>160个token)上,交叉注意力模型表现更优。
  • 两种模型在基于Twitter的数据集上对中性情感预测均表现不佳,但交叉注意力模型在中性标签上的错误率更高。
  • 标签表述方式的选择(如身份假设)对性能无显著影响,表明直接使用标签名称已足够。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。