Skip to main content
QUICK REVIEW

[论文解读] FewJoint: A Few-shot Learning Benchmark for Joint Language Understanding

Yutai Hou, Jiafeng Mao|arXiv (Cornell University)|Sep 17, 2020
Topic Modeling参考文献 24被引用 13
一句话总结

FewJoint 提出了一种用于任务导向对话中联合语言理解的新型少样本学习基准,涵盖59个真实世界领域,涵盖意图识别与槽位标注,以反映真实自然语言处理的复杂性。该基准无需依赖合成领域即可实现评估,并表明通过微调进行联合学习可显著提升少样本性能,在3-shot设置下达到38.97%的句子准确率。

ABSTRACT

Few-shot learning (FSL) is one of the key future steps in machine learning and has raised a lot of attention. However, in contrast to the rapid development in other domains, such as Computer Vision, the progress of FSL in Nature Language Processing (NLP) is much slower. One of the key reasons for this is the lacking of public benchmarks. NLP FSL researches always report new results on their own constructed few-shot datasets, which is pretty inefficient in results comparison and thus impedes cumulative progress. In this paper, we present FewJoint, a novel Few-Shot Learning benchmark for NLP. Different from most NLP FSL research that only focus on simple N-classification problems, our benchmark introduces few-shot joint dialogue language understanding, which additionally covers the structure prediction and multi-task reliance problems. This allows our benchmark to reflect the real-word NLP complexity beyond simple N-classification. Our benchmark is used in the few-shot learning contest of SMP2020-ECDT task-1. We also provide a compatible FSL platform to ease experiment set-up.

研究动机与目标

  • 通过引入一个真实、领域多样化的基准,解决少样本自然语言处理中缺乏标准化评估基准的问题。
  • 通过包含结构化预测(如序列标注)和多任务学习(如意图与槽位的联合预测),反映真实世界自然语言处理的复杂性。
  • 在不依赖人工构建或虚假领域的情况下,实现少样本模型评估的公平性与可复现性。
  • 提供一个兼容的少样本学习平台,以简化模型训练、评估与比较。
  • 通过在多样化、真实工业对话领域中标准化评估,推动少样本自然语言处理的累积性进展。

提出的方法

  • 使用来自工业API的59个真实对话领域构建基准,避免生成合成领域。
  • 将少样本学习任务定义为在未见过的领域上进行联合意图检测(分类)与槽位标注(序列标注)。
  • 使用原型网络(如SepProto、JointProto)进行少样本分类,无需微调,利用支持集中的类别原型。
  • 通过logits依赖性技巧实现联合学习,使意图与槽位预测任务共享监督信号。
  • 在目标领域的支持集上应用微调(JointProto + Finetune),以适应新领域。
  • 使用BERT-base嵌入并配合平均池化,应用嵌入技巧(如成对嵌入、渐进式解冻)以提升表示学习效果。

实验结果

研究问题

  • RQ1一个包含结构化预测与多任务学习的少样本自然语言处理基准,是否能比仅聚焦于简单分类的现有基准更好地反映真实世界自然语言处理的复杂性?
  • RQ2与独立学习任务相比,联合学习意图检测与槽位标注在少样本性能上有多大的提升?
  • RQ3在3-shot支持集上进行微调,能在多大程度上提升少样本联合语言理解的性能?
  • RQ4与使用合成或虚假领域相比,使用真实世界、多样化的对话领域是否能带来更可靠且泛化能力更强的少样本模型评估?
  • RQ5标准化平台是否能提升少样本自然语言处理方法之间的可复现性与公平比较?

主要发现

  • 在3-shot设置下,使用JointProto + Finetune方法,FewJoint实现了38.97%的句子准确率,显著优于JointProto(23.65%)和SepProto(16.40%)。
  • 联合学习(JointProto)相比独立学习(SepProto)将句子准确率提升了7.25个百分点,证明了任务交互的益处。
  • 在支持集上进行微调,使槽位F1分数从JointProto的40.37%提升至JointProto + Finetune的61.79%,表明领域特定适应极为有效。
  • 该基准包含的59个真实世界对话领域消除了对合成领域构建的依赖,提升了评估的可靠性与现实相关性。
  • 通过共享BERT嵌入与logits依赖性实现的联合学习,带来了更优的表示学习与更强的少样本泛化能力。
  • 所提出的少样本学习平台实现了跨模型的一致性与可复现性评估,促进了公平比较与迭代进步。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。