Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Text Classification with Induction Network.

Ruiying Geng, Binhua Li|arXiv (Cornell University)|Feb 27, 2019
Topic Modeling被引用 19
一句话总结

该论文提出了一种归纳网络(Induction Network),通过在元学习框架内使用动态路由,从支持集学习通用的、类别特异的表征,从而提升少样本文本分类性能。该模型在英文情感分类和中文对话意图分类数据集上,平均准确率均比当前最先进方法高出3%以上。

ABSTRACT

Text classification tends to struggle when data is deficient or when it needs to adapt to unseen classes. In such challenging scenarios, recent studies often use meta learning to simulate the few-shot task, in which new queries are compared to a small support set on a sample-wise level. However, this sample-wise comparison may be severely disturbed by the various expressions in the same class. Therefore, we should be able to learn a general representation of each class in the support set and then compare it to new queries. In this paper, we propose a novel Induction Network to learn such generalized class-wise representations, innovatively combining the dynamic routing algorithm with the typical meta learning framework. In this way, our model is able to induce from particularity to university, which is a more human-like learning approach. We evaluate our model on a well-studied sentiment classification dataset (English) and a real-world dialogue intent classification dataset (Chinese). Experiment results show that, on both datasets, our model significantly outperforms existing state-of-the-art models and improves the average accuracy by more than 3%, which proves the effectiveness of class-wise generalization in few-shot text classification.

研究动机与目标

  • 解决训练数据稀缺或新类别出现时的少样本文本分类挑战。
  • 克服元学习中基于样本的比较方法对类别内表达差异敏感的局限性。
  • 开发一种方法,使模型能够跨同一类别的样本进行泛化,形成稳健的类别级表征。
  • 通过新型架构使元学习模型能够模仿人类归纳推理——从具体例子推导出一般概念。
  • 通过聚焦于类别级泛化而非实例级匹配,提升低资源文本分类任务的性能。

提出的方法

  • 提出一种归纳网络,利用动态路由从少量支持集学习通用的、类别级表征。
  • 将动态路由与元学习框架结合,实现支持样本基于注意力机制的聚合,形成统一的类别原型。
  • 采用可微分的路由机制,根据各支持样本与类别的相关性,自适应地加权其贡献。
  • 采用元训练策略进行端到端训练,每个训练周期(episode)模拟一个少样本分类任务,包含支持集与查询集。
  • 应用注意力机制,将查询样本与归纳得到的类别表征对齐,实现在低样本场景下的准确预测。
  • 利用动态路由的归纳偏差,从具体样本泛化到抽象的类别级概念,提升对表达差异的鲁棒性。

实验结果

研究问题

  • RQ1从少量支持样本中学习通用类别表征,是否能超越实例级匹配,在少样本文本分类中实现性能提升?
  • RQ2通过动态路由实现的类别级泛化,与元学习中传统的基于样本的比较方法相比,在文本分类任务中表现如何?
  • RQ3所提出的归纳网络在标签数据有限的多样化文本分类任务中,其泛化能力有多强?
  • RQ4在低资源、真实世界场景(如对话意图分类)中,该模型是否仍能保持性能优势?
  • RQ5该模型能否通过从文本中的具体例子推导出一般性概念,实现类人归纳推理?

主要发现

  • 归纳网络在英文情感分类和中文对话意图分类数据集上,显著优于现有最先进模型。
  • 与先前方法相比,平均准确率提升超过3%,验证了类别级泛化的有效性。
  • 性能增益在低资源和真实世界文本分类基准中均保持一致,表明模型具有鲁棒性。
  • 动态路由机制通过将同一类别内的多样化表达聚合为统一原型,实现了更优的表征学习。
  • 由于能够从有限的支持样本中归纳出通用的类别级特征,该模型在未见类别上表现出更优的泛化能力。
  • 结果验证了类别级泛化是超越实例级匹配、提升少样本文本分类性能的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。