Skip to main content
QUICK REVIEW

[论文解读] Vector Projection Network for Few-shot Slot Tagging in Natural Language Understanding

Su Zhu, Ruisheng Cao|arXiv (Cornell University)|Sep 21, 2020
Topic Modeling参考文献 28被引用 11
一句话总结

本文提出一种用于少样本槽位标注的向量投影网络(VPN),通过将上下文词嵌入投影到归一化标签向量上,计算词-标签相似度,本质上是一种带有自适应偏置的归一化线性模型。该方法实现了最先进性能,在 SNIPS 和 NER 数据集的 5-shot 设置下,分别比最强基线高出 6.30 和 13.79 的 F1 分数,且通过标签向量半范数阈值提升了对假阳性结果的鲁棒性。

ABSTRACT

Few-shot slot tagging becomes appealing for rapid domain transfer and adaptation, motivated by the tremendous development of conversational dialogue systems. In this paper, we propose a vector projection network for few-shot slot tagging, which exploits projections of contextual word embeddings on each target label vector as word-label similarities. Essentially, this approach is equivalent to a normalized linear model with an adaptive bias. The contrastive experiment demonstrates that our proposed vector projection based similarity metric can significantly surpass other variants. Specifically, in the five-shot setting on benchmarks SNIPS and NER, our method outperforms the strongest few-shot learning baseline by $6.30$ and $13.79$ points on F$_1$ score, respectively. Our code will be released at https://github.com/sz128/few_shot_slot_tagging_and_NER.

研究动机与目标

  • 解决在极少标注数据下自然语言理解中的快速领域适应挑战。
  • 通过设计稳健的词-标签相似度度量,提升少样本槽位标注的泛化能力。
  • 通过自适应阈值化方法,减少低资源标签预测中的假阳性错误。
  • 在 SNIPS 和 NER 基准测试的 1-shot 和 5-shot 设置下,超越现有少样本学习基线。

提出的方法

  • 通过将上下文词嵌入投影到归一化标签向量上,计算词-标签相似度。
  • 将每个标签向量的半范数用作自适应偏置项,以抑制假阳性预测。
  • 将相似度形式化为归一化线性模型,其中标签向量充当投影方向。
  • 将偏置项整合到打分函数中,以提升低样本场景下的泛化能力。
  • 在原型网络或类似少样本学习框架中集成该方法,用于序列标注。
  • 通过消融实验比较向量投影与点积、余弦相似度以及平方欧氏距离的性能。

实验结果

研究问题

  • RQ1在少样本槽位标注中,将词嵌入向量投影到标签向量上,是否能比标准度量方法获得更稳健的相似度度量?
  • RQ2将标签向量的半范数作为可学习偏置项,是否能有效减少低样本场景下的假阳性错误?
  • RQ3在自然语言理解基准测试中,该方法与 TapNet 和原型网络等最先进少样本学习模型相比表现如何?
  • RQ4在所提出的框架中,标签名称嵌入在多大程度上提升了性能?

主要发现

  • 在 SNIPS 数据集的 5-shot 设置下,所提出的向量投影方法相比最强基线实现了 6.30 个百分点的绝对 F1 分数提升。
  • 在 NER 数据集的 5-shot 设置下,该方法实现了 13.79 的 F1 分数提升,表现出更优的泛化能力。
  • 引入半范数偏置(VPB)显著减少了假阳性错误,尤其在包含多个支持样本的 5-shot 场景中效果明显。
  • 该方法不仅优于余弦相似度和点积等标准相似度度量,也优于更复杂的基线方法如 PWE 和 CDT。
  • 错误分析显示,在 SNIPS 和 NER 数据集中,'O-X' 和 'X-X' 类错误类型显著减少,表明槽位边界检测精度得到提升。
  • 在所提出的框架中,标签名称嵌入带来的收益微乎其微,表明向量投影机制已足够实现有效的相似度学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。