Skip to main content
QUICK REVIEW

[论文解读] SURFACE: Semantically Rich Fact Validation with Explanations

Ankur Padia, Francis Ferraro|arXiv (Cornell University)|Oct 31, 2018
Topic Modeling被引用 4
一句话总结

SURFACE 是一种多任务神经模型,利用 FrameNet 结构化的语义框架,联合检索相关的 Wikipedia 句子并分类声明为支持、反驳或不确定。在 FEVER 数据集上,该模型在证据检索方面相比最先进基线实现了 90% 的相对性能提升,在分类准确率方面实现了约 70% 的相对性能提升。

ABSTRACT

Judging the veracity of a sentence making one or more claims is an important and challenging problem with many dimensions. The recent FEVER task asked participants to classify input sentences as either SUPPORTED, REFUTED or NotEnoughInfo using Wikipedia as a source of true facts. SURFACE does this task and explains its decision through a selection of sentences from the trusted source. Our multi-task neural approach uses semantic lexical frames from FrameNet to jointly (i) find relevant evidential sentences in the trusted source and (ii) use them to classify the input sentence's veracity. An evaluation of our efficient three-parameter model on the FEVER dataset showed an improvement of 90% over the state-of-the-art baseline on retrieving relevant sentences and a 70% relative improvement in classification.

研究动机与目标

  • 为使用像 Wikipedia 这类可信来源自动验证自然语言声明中的事实挑战提供解决方案。
  • 通过从 Wikipedia 中提取语义基础的、可提取的证据句子,提升声明分类的可解释性。
  • 通过使用语义框架的多任务学习框架,联合优化证据检索与声明分类。
  • 通过利用 FrameNet 提供的丰富语义表示,减少对 TF-IDF 等启发式检索方法的依赖。
  • 证明引入句子实用度预测可参数高效地提升检索与分类性能。

提出的方法

  • 使用 FrameNet 词汇框架从声明和 Wikipedia 句子中提取语义表示,实现证据检索的语义匹配。
  • 采用多任务学习架构,模型联合预测候选句子的证据相关性与句子实用度(重要性)。
  • 在训练过程中应用 Gumbel-Softmax 重参数化技巧,以差异化方式选择高实用度证据句子,提升端到端优化效果。
  • 采用三参数模型族:Verifier、Verifier + MultiTask 和 Verifier + MultiTask with Gumbel utility,逐步增加复杂度与性能。
  • 基于框架的句子匹配,从 Wikipedia 中识别候选证据句子,随后进行基于实用度的过滤与分类。
  • 采用参数高效的架构设计,共享句子编码器,任务特定头分别用于检索与分类,实现高效训练与推理。

实验结果

研究问题

  • RQ1与传统的 TF-IDF 方法相比,FrameNet 提供的语义框架是否能提升声明验证中相关证据句子的检索效果?
  • RQ2通过多任务学习联合学习证据检索与声明分类,是否优于分别优化?
  • RQ3对证据句子实用度(重要性)的预测,如何影响最终分类准确率与检索 F1 分数?
  • RQ4后处理(如移除低实用度句子)在多大程度上影响检索召回率与整体 FEVER 得分?
  • RQ5在架构复杂度极低的前提下,参数高效的模型是否能超越 FEVER 基准上的最先进基线?

主要发现

  • SURFACE 在 FEVER 数据集上相比最先进基线,证据检索性能实现了 90% 的相对提升。
  • 模型最佳配置(Verifier + MultiTask)在开发集上取得 0.3452 的 FEVER 得分,相比基线在分类性能上实现了约 70% 的相对提升。
  • 多任务学习的使用显著提升了分类性能,Verifier + MultiTask 模型优于单任务和 Gumbel 正则化变体。
  • 通过后处理移除低实用度证据句子(u=10)导致召回率与 F1 分数下降,FEVER 得分从 0.3452 降至 0.2554,表明此类过滤会损害整体性能。
  • 与原始实用度分数相比,Gumbel-Softmax 实用度预测未带来性能提升,尽管将训练周期增加至 100 能在一定程度上缓解这一差距。
  • 增加基于框架的句子检索数量(K)可提升性能,但当包含过多句子时性能开始下降,表明存在最优的检索窗口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。