Skip to main content
QUICK REVIEW

[论文解读] Using Natural Language Relations between Answer Choices for Machine Comprehension

Rajkumar Pujari, Dan Goldwasser|arXiv (Cornell University)|Dec 31, 2020
Topic Modeling参考文献 25被引用 4
一句话总结

该论文提出了一种通过利用答案选项之间的自然语言蕴涵(NLI)关系(如蕴涵和矛盾)来提升机器阅读理解的方法。该方法结合独立的问答(QA)系统、自然语言蕴涵(NLI)模型以及基于整数线性规划(ILP)的推理框架,联合重新评估答案选项,在MultiRC和SemEval-2018 Task-11上取得了最先进结果,使用自训练数据在MultiRC上的EM0得分为21.62%。

ABSTRACT

When evaluating an answer choice for Reading Comprehension task, other answer choices available for the question and the answers of related questions about the same paragraph often provide valuable information. In this paper, we propose a method to leverage the natural language relations between the answer choices, such as entailment and contradiction, to improve the performance of machine comprehension. We use a stand-alone question answering (QA) system to perform QA task and a Natural Language Inference (NLI) system to identify the relations between the choice pairs. Then we perform inference using an Integer Linear Programming (ILP)-based relational framework to re-evaluate the decisions made by the standalone QA system in light of the relations identified by the NLI system. We also propose a multitask learning model that learns both the tasks jointly.

研究动机与目标

  • 通过建模答案选项之间的语用一致性来提升机器阅读理解性能。
  • 解决独立问答系统仅孤立评估每个选项、忽略选项间关系的局限性。
  • 探究答案选项之间的自然语言蕴涵(蕴涵、矛盾、中性)关系是否能增强推理与预测准确性。
  • 开发一种联合学习框架,整合QA与NLI任务以提升泛化能力。
  • 研究在MultiRC数据集上进行自训练对NLI模型关系检测性能的影响。

提出的方法

  • 独立的问答(QA)系统为每个答案选项分配初始的真假标签和置信度分数。
  • 独立的自然语言蕴涵(NLI)系统对每个问题的所有有序答案选项对进行关系分类(蕴涵、矛盾、中性)。
  • 基于整数线性规划(ILP)的关系推理框架利用NLI关系重新评估QA预测结果,以确保逻辑一致性。
  • 联合多任务学习模型同时训练QA与NLI组件,共享表示以提升两个任务的性能。
  • 利用MultiRC数据集的预测结果对NLI模型进行自训练,以提升关系检测性能。
  • 该框架将QA系统和NLI系统的置信度分数作为ILP优化过程的输入。

实验结果

研究问题

  • RQ1建模答案选项之间的自然语言蕴涵关系是否能提升机器阅读理解性能?
  • RQ2基于ILP的推理在利用NLI关系强制实现答案选项间一致性方面有多有效?
  • RQ3QA与NLI组件的联合训练是否比独立训练带来更好的性能?
  • RQ4在MultiRC数据集上进行自训练在多大程度上提升了对答案选项对的关系检测能力?
  • RQ5除了严格的蕴涵/矛盾关系之外,隐含或上下文相关的语义关系是否能进一步提升理解能力?

主要发现

  • 当使用自训练的NLI模型时,该方法将MultiRC数据集上的EM0得分从独立QA系统的18.15%提升至21.62%。
  • 联合模型在MultiRC上实现了20.36%的EM0和57.08%的EM1,优于独立QA系统及其他基线模型。
  • 在SemEval-2018 Task-11数据集上,联合模型在开发集上达到85.4%的准确率,在测试集上达到82.1%的准确率,优于独立的TriAN-single模型。
  • 通过McNemar卡方检验确认,该提升具有统计显著性。
  • NLI模型的性能受限于高词汇重叠和否定词,尤其影响了蕴涵关系的检测。
  • 在MultiRC数据集上进行自训练表明,答案选项之间存在非蕴涵/非矛盾关系,提示需建模更广泛的语义关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。