Skip to main content
QUICK REVIEW

[论文解读] UKP-Athene: Multi-Sentence Textual Entailment for Claim Verification

Andreas Hanselowski, Hao Zhang|arXiv (Cornell University)|Sep 3, 2018
Topic Modeling参考文献 9被引用 11
一句话总结

本文提出 UKP-Athene,一种主张验证流水线,通过增强的 ESIM 模型结合多句蕴含关系,对证据句子进行排序并分类主张。该系统在 FEVER 2018 共享任务中获得第三名,通过整合实体链接进行文档检索,以及采用注意力机制的 ESIM 扩展进行句子排序与蕴含分类,其在开发集上的 FEVER 得分达到 64.74%,显著优于基线模型。

ABSTRACT

The Fact Extraction and VERification (FEVER) shared task was launched to support the development of systems able to verify claims by extracting supporting or refuting facts from raw text. The shared task organizers provide a large-scale dataset for the consecutive steps involved in claim verification, in particular, document retrieval, fact extraction, and claim classification. In this paper, we present our claim verification pipeline approach, which, according to the preliminary results, scored third in the shared task, out of 23 competing systems. For the document retrieval, we implemented a new entity linking approach. In order to be able to rank candidate facts and classify a claim on the basis of several selected facts, we introduce two extensions to the Enhanced LSTM (ESIM).

研究动机与目标

  • 开发一种基于维基百科证据的自动化主张验证鲁棒流水线。
  • 通过将文档检索问题建模为使用短语结构解析与基于规则的匹配的实体链接任务,提升文档检索性能。
  • 通过扩展的 ESIM 模型增强句子选择能力,以对相关证据句子进行排序。
  • 通过将 ESIM 适配为可同时基于多个支持或反驳事实对主张进行联合分类,实现多句文本蕴含。
  • 通过端到端集成的完整主张验证流程,在 FEVER 共享任务中实现最先进性能。

提出的方法

  • 使用短语结构解析实现基于规则的实体链接系统,从主张中提取实体提及,并将其匹配到维基百科文章标题。
  • 开发基于增强序列推理模型(ESIM)的句子排序模型,从检索到的文档中识别相关证据句子。
  • 通过引入注意力机制扩展 ESIM,以同时处理多条输入句子与主张,支持多句文本蕴含。
  • 使用双向 LSTM 对主张和证据句子进行上下文编码,随后通过注意力池化以及最大/平均池化进行表征学习。
  • 将三个子模块——文档检索、句子选择与蕴含分类——整合为一个端到端的主张验证流水线。
  • 使用预训练词嵌入(GloVe/FastText)进行训练,并在 FEVER 数据集上进行微调,同时在开发集上进行超参数优化。

实验结果

研究问题

  • RQ1如何有效应用实体链接以提升主张验证系统中的文档检索性能?
  • RQ2扩展的 ESIM 模型是否能够提升从检索到的维基百科文章中进行句子排序与证据选择的能力?
  • RQ3如何建模多句文本蕴含,以在存在多个事实时支持准确的主张分类?
  • RQ4注意力机制在整合多条证据句子用于主张验证方面有何影响?
  • RQ5基于流水线的方法在 FEVER 共享任务中能在多大程度上超越基线系统?

主要发现

  • 基于实体链接的文档检索系统准确率达到 93.55%,显著优于基线的 70.20%。
  • 句子排序模型将召回率从基线的 44.22% 提升至 87.10%,表明具备强大的证据句子提取能力。
  • 多句蕴含模型的标签准确率达到 68.49%,远超基线的 52.09%。
  • 完整流水线系统的 FEVER 评估得分达到 64.74%,超过基线得分 32.27% 的两倍以上。
  • 错误分析显示,数值推理与指代消解仍是主要挑战,尤其在被驳回和信息不足的主张中更为明显。
  • 拼写错误、实体提及缺失以及文章标题中的歧义是导致文档检索失败的主要原因。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。