Skip to main content
QUICK REVIEW

[论文解读] FewRel 2.0: Towards More Challenging Few-Shot Relation Classification

Tianyu Gao, Xu Han|arXiv (Cornell University)|Oct 16, 2019
Topic Modeling参考文献 21被引用 5
一句话总结

FewRel 2.0 通过引入生物医学领域测试集以评估少样本领域自适应能力,并增加‘以上皆非’(NOTA)关系选项,构建了一个更具挑战性的少样本关系分类基准。尽管采用了 SOTA 模型如 BERT-PAIR 和原型网络,模型在两项挑战上的性能均显著下降,暴露出当前方法在真实世界领域偏移和开放词汇分类方面存在关键缺陷。

ABSTRACT

We present FewRel 2.0, a more challenging task to investigate two aspects of few-shot relation classification models: (1) Can they adapt to a new domain with only a handful of instances? (2) Can they detect none-of-the-above (NOTA) relations? To construct FewRel 2.0, we build upon the FewRel dataset (Han et al., 2018) by adding a new test set in a quite different domain, and a NOTA relation choice. With the new dataset and extensive experimental analysis, we found (1) that the state-of-the-art few-shot relation classification models struggle on these two aspects, and (2) that the commonly-used techniques for domain adaptation and NOTA detection still cannot handle the two challenges well. Our research calls for more attention and further efforts to these two real-world issues. All details and resources about the dataset and baselines are released at https: //github.com/thunlp/fewrel.

研究动机与目标

  • 为解决少样本关系分类模型在域外设置下缺乏真实世界评估的问题。
  • 探究在少样本学习中检测‘以上皆非’(NOTA)关系的可行性,这是关键但被忽视的挑战。
  • 评估现有少样本学习技术在跨领域泛化及处理开放词汇分类方面的能力。
  • 发布一个包含生物医学测试集和 NOTA 关系的新基准,以推动鲁棒少样本泛化研究。
  • 证明当前 SOTA 模型在少样本领域自适应与少样本 NOTA 任务上均面临显著困难,凸显开发新方法的迫切需求。

提出的方法

  • 从 PubMed 生物医学语料库中构建新的测试集,与原始基于 Wikipedia 的 FewRel 数据集形成对比,以评估领域偏移影响。
  • 在少样本设置中引入 NOTA 关系类别,其中查询可能不属于 N 个采样关系中的任何一个。
  • 通过在训练期间将 NOTA 视为第 N+1 个类别,对原型网络和 BERT-PAIR 模型进行改进以支持 NOTA 处理。
  • 对原型网络应用对抗性训练,以提升领域泛化能力,旨在减轻领域偏移的影响。
  • 在不同的 NOTA 比例(0%、15%、30%、50%)下训练模型,以评估对未见关系比例增加的鲁棒性。
  • 使用基于 BERT 的句子编码器和特定关系的分类头,以增强上下文理解与零样本泛化能力。

实验结果

研究问题

  • RQ1最先进的少样本关系分类模型是否能在仅有少量标注样本的情况下,泛化到新领域(如生物医学)?
  • RQ2当查询可能属于训练期间未见的‘以上皆非’(NOTA)关系时,现有少样本模型表现如何?
  • RQ3对抗性训练与微调在少样本关系分类中的领域自适应方面能带来多大程度的改进?
  • RQ4随着测试集中 NOTA 关系比例的增加,模型性能下降的程度如何?
  • RQ5BERT-PAIR 和原型网络能否被有效适配,以同时应对领域偏移与开放词汇分类?

主要发现

  • 最先进的模型(包括 BERT-PAIR 和原型网络)在生物医学领域测试时性能显著下降,降幅高达 16–17 个百分点,表明其在少样本领域自适应方面表现极差。
  • 即使采用对抗性训练,模型在新领域上的表现仍不理想,说明当前的领域自适应技术在少样本设置下仍显不足。
  • 当 NOTA 被忽略时(标记为 *),模型准确率下降 8–13 个百分点,证明将 NOTA 视为独立类别至关重要。
  • BERT-PAIR 在少样本领域自适应与 NOTA 任务中表现最佳,5 类 1 样本领域自适应准确率达 80.31%,5 类 5 样本且 NOTA 占 50% 时准确率达 86.06%,但仍低于 0% NOTA 的基线水平。
  • 仅在训练集中增加 1,000 个生物医学样本,即可使 BERT-PAIR 的准确率提升至 72.30%(5 类 1 样本)和 80.50%(5 类 5 样本),表明仍有巨大提升空间。
  • 0% NOTA 与 50% NOTA 设置之间的性能差距依然显著(1 样本时差 8 个百分点,5 样本时差 7 个百分点),表明 NOTA 检测仍是尚未解决的重大挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。