Skip to main content
QUICK REVIEW

[论文解读] Learning as Abduction: Trainable Natural Logic Theorem Prover for Natural Language Inference

Lasha Abzianidze|arXiv (Cornell University)|Oct 29, 2020
Natural Language Processing Techniques参考文献 39被引用 7
一句话总结

本文提出了一种可训练的自然语言逻辑推理定理证明器,通过将学习建模为归谬推理(abduction)——即反转定理证明以推断最能解释黄金推理标签的语义关系。该方法在类似SNLI的SICK数据集上将基于表格的定理证明器性能提升了1.4%,同时保持了超过94%的精确率,证明了归谬学习能够实现有效且数据驱动的知识获取,适用于符号化NLP系统。

ABSTRACT

Tackling Natural Language Inference with a logic-based method is becoming less and less common. While this might have been counterintuitive several decades ago, nowadays it seems pretty obvious. The main reasons for such a conception are that (a) logic-based methods are usually brittle when it comes to processing wide-coverage texts, and (b) instead of automatically learning from data, they require much of manual effort for development. We make a step towards to overcome such shortcomings by modeling learning from data as abduction: reversing a theorem-proving procedure to abduce semantic relations that serve as the best explanation for the gold label of an inference problem. In other words, instead of proving sentence-level inference relations with the help of lexical relations, the lexical relations are proved taking into account the sentence-level inference relations. We implement the learning method in a tableau theorem prover for natural language and show that it improves the performance of the theorem prover on the SICK dataset by 1.4% while still maintaining high precision (>94%). The obtained results are competitive with the state of the art among logic-based systems.

研究动机与目标

  • 为解决符号化自然语言推理(NLI)系统中缺乏数据驱动学习的问题,这些系统传统上依赖于人工构建的词典知识库(如WordNet)。
  • 克服逻辑化NLI系统在扩展至广泛覆盖文本时的脆弱性,通过从训练数据中自动获取领域特定的语义关系。
  • 开发一种计算上可行的学习方法,将归谬推理整合进基于表格的自然语言逻辑定理证明器中。
  • 评估所学关系是否能在不牺牲精确率的前提下提升推理性能,以及是否能部分替代外部知识库。

提出的方法

  • 该方法反转了标准定理证明的工作流程:不是从词汇关系推导句子级推理,而是推断最可能的词汇关系,以解释黄金标签。
  • 归谬被形式化为逆向定理证明,系统搜索在假设下能蕴含黄金标签的语义关系(例如,“put on”与“remove”不兼容)。
  • 通过仅关注表格所有开放分支中共享的T-集合(语义关系集合),缩小解释空间,确保一致性。
  • 应用一系列过滤器和比较标准,以消除不切实际或过度依赖上下文的关系,减少伪知识。
  • 系统使用基于表格的自然语言逻辑定理证明器(LangPro),并集成归谬学习组件,在训练过程中动态扩展其知识库。
  • 该方法使用SICK数据集进行评估,采用多种CCG解析器,结果与当前最先进的基于逻辑的系统进行比较。

实验结果

研究问题

  • RQ1是否存在一种计算上可行的学习方法,使自然语言定理证明器能够针对NLI问题进行训练?
  • RQ2在NLI的归谬学习中,如何避免学习伪知识?
  • RQ3所学知识能否替代WordNet等词典知识库?
  • RQ4所学知识在多大程度上提升了证明器的性能?

主要发现

  • 归谬学习方法使LangPro定理证明器在SICK测试集上的性能提升了1.4个百分点,成为基于逻辑的系统中的新SOTA。
  • 即使在从数据中学习后,系统仍保持高精确率(>94%),表明过滤机制能有效抑制伪知识。
  • 尽管从数据中学习,WordNet派生的词汇关系对实现顶尖性能依然至关重要,表明仅靠学习知识无法完全替代精心构建的词汇数据库。
  • 归谬学习组件在不同CCG解析器上均一致地提升了性能,无论单独使用还是在集成设置中。
  • 该方法成功证明了符号化NLI系统可以通过归谬实现数据训练,为黑盒深度学习模型提供了透明且可解释的替代方案。
  • 结果表明,归谬学习是自然逻辑中数据驱动知识获取的一种可行且有效的方法,尤其适用于提升符号化NLP系统的推理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。