Skip to main content
QUICK REVIEW

[论文解读] Few-shot Text Classification with Distributional Signatures

Yujia Bao, Menghua Wu|arXiv (Cornell University)|Aug 16, 2019
Domain Adaptation and Few-Shot Learning参考文献 44被引用 88
一句话总结

提出一种元学习模型,使用分布式签名来生成词级注意力,从而在少样本文本与关系分类中实现有效性,并优于词汇基线。

ABSTRACT

In this paper, we explore meta-learning for few-shot text classification. Meta-learning has shown strong performance in computer vision, where low-level patterns are transferable across learning tasks. However, directly applying this approach to text is challenging--lexical features highly informative for one task may be insignificant for another. Thus, rather than learning solely from words, our model also leverages their distributional signatures, which encode pertinent word occurrence patterns. Our model is trained within a meta-learning framework to map these signatures into attention scores, which are then used to weight the lexical representations of words. We demonstrate that our model consistently outperforms prototypical networks learned on lexical knowledge (Snell et al., 2017) in both few-shot text classification and relation classification by a significant margin across six benchmark datasets (20.0% on average in 1-shot classification).

研究动机与目标

  • 激励并改进少样本文本分类,在任务之间仅靠词汇特征的迁移效果较差的情况下。
  • 利用分布式签名(如一元统计)跨任务传递注意力。
  • 将注意力生成器与岭回归器集成,以实现从少量标记样本快速适应。
  • 提供对对词汇替换扰动鲁棒性的理论依据。
  • 在六个文本和关系分类数据集上进行经验验证,显示相对基线的提升。

提出的方法

  • 定义分布式签名 s(x) 和 t(x),用于捕捉通用词重要性和类别特定重要性。
  • 将 s(x) 与 t(x) 拼接并与双向 LSTM 融合,通过与学习向量的点积计算词级注意力 α_i。
  • 对每个输入词嵌入使用注意力加权词汇表示 φ(x) = sum_i α_i f_ebd(x_i)。
  • 在支持集上训练岭回归器,将 φ(x) 映射到类别标签,闭式解 W = Φ_S^T(Φ_SΦ_S^T + λI)^{-1}Y_S。
  • 在查询集上用 Y_Q_hat = a Φ_Q W + b 进行刻度,并应用 softmax 得到概率。
  • 通过查询集的交叉熵损失端到端训练注意力生成器,使用岭回归器反馈。
  • 证明 AttGen 在保持一元概率的双射下对词替换扰动不变。

实验结果

研究问题

  • RQ1分布式签名是否可以用于跨 NLP 任务传递注意力,以实现鲁棒的少样本学习?
  • RQ2在少样本设置下,由分布式签名引导的注意力生成器是否优于词汇元学习在文本和关系分类上的表现?
  • RQ3学习得到的注意力对词替换扰动是否鲁棒并能推广到未见类?
  • RQ4所提架构在多样数据集(文本与关系)上,在 1-shot 和 5-shot 下的表现如何?

主要发现

  • 该模型在六个数据集的 1-shot 和 5-shot 设置下均达到最佳准确率。
  • 平均而言,该模型在 5 类 1-shot 的准确率上比最佳基线提升 7.5%,在 5 类 5-shot 的准确率上提升 3.9%。
  • 与 cnn + 原型相比,在 Reuters/其他数据集的 1-shot 分类上平均提升 20.0%。
  • 消融实验显示 s(·) 与 t(·) 对性能均有贡献,且 s(·) 影响较大,biLSTM 融合略有提升。
  • 该模型比词汇表感知的元学习者对未见类别具有更好的泛化,如 Reuters 的学习曲线和定性注意力可视化所示。
  • BERT 上下文化提升 FewRel 的性能,但对 HuffPost 无效,表明上下文表示的增益存在任务依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。