Skip to main content
QUICK REVIEW

[论文解读] A Knowledge Hunting Framework for Common Sense Reasoning

Ali Emami, Noelia De La Cruz|arXiv (Cornell University)|Jan 1, 2018
Topic Modeling参考文献 21被引用 4
一句话总结

本文提出了一种知识搜寻框架,利用网络搜索动态检索并分类常识知识,以解决代词回指和因果推理任务。通过从问题结构生成针对性查询,从搜索结果中提取相关证据,并基于可信度加权,该系统在Winograd Schema Challenge上的F1得分为0.51,超越了之前的最先进方法0.21,成为首个F1得分超过0.5的系统。

ABSTRACT

We introduce an automatic system that achieves state-of-the-art results on the Winograd Schema Challenge (WSC), a common sense reasoning task that requires diverse, complex forms of inference and knowledge. Our method uses a knowledge hunting module to gather text from the web, which serves as evidence for candidate problem resolutions. Given an input problem, our system generates relevant queries to send to a search engine, then extracts and classifies knowledge from the returned results and weighs them to make a resolution. Our approach improves F1 performance on the full WSC by 0.21 over the previous best and represents the first system to exceed 0.5 F1. We further demonstrate that the approach is competitive on the Choice of Plausible Alternatives (COPA) task, which suggests that it is generally applicable.

研究动机与目标

  • 解决自然语言处理中常识推理的挑战,特别是需要超越句法的世界知识来解决模糊代词和因果关系的问题。
  • 克服静态知识库和神经网络模型在捕捉常识知识广度和多样性方面的局限性。
  • 开发一种通用系统,能够通过从网络动态获取知识来解决所有Winograd Schema Challenge实例(而不仅限于受限子集)。
  • 证明该方法在其他常识推理任务(如Choice of Plausible Alternatives,COPA)中的可扩展性。
  • 通过利用信息检索技术从现实世界文本中获取证据,提升Winograd Schema Challenge上的性能,超越先前方法。

提出的方法

  • 将输入问题解析为语义表示模式,以捕捉关键实体、谓词和关系。
  • 从该模式生成针对性的搜索查询,利用句法和语义线索以提高相关性。
  • 使用搜索引擎检索包含候选知识的网页片段,然后使用自然语言处理工具解析并过滤结果。
  • 基于与候选解决方式的句法和语义一致性,对检索到的证据进行分类和打分,使用启发式方法评估可信度。
  • 应用加权投票机制,综合多个片段中的证据强度,选择最被支持的先行词或替代项。
  • 通过为每个候选生成两组查询,将框架适配至COPA任务,强制检索结果中体现时间或因果顺序。

实验结果

研究问题

  • RQ1基于网络的动态知识检索是否能在常识推理任务中超越静态知识库和神经网络模型?
  • RQ2来自网络的真实世界文本证据在多大程度上能够解决Winograd Schema Challenge中模糊代词指代的问题?
  • RQ3该知识搜寻框架是否能有效推广到其他常识推理任务(如COPA)?
  • RQ4查询生成质量和结果过滤如何影响系统的可靠性和性能?
  • RQ5信息检索技术是否能有效建模现有语料库中未捕捉到的长尾、隐含或罕见的常识知识?

主要发现

  • 所提出的知识搜寻框架在完整Winograd Schema Challenge上的F1得分为0.51,相较于之前的最先进方法提升了0.21。
  • 它是首个在Winograd Schema Challenge上F1得分超过0.5的系统,展示了性能的显著飞跃。
  • 该系统在COPA任务上表现具有竞争力,使用简化版AGQ方法在测试集上达到66.2%的准确率,显示出良好的泛化潜力。
  • 在COPA任务中使用WordNet同义词进行查询扩展并未提升性能,甚至可能引入噪声,表明同义词注入需要谨慎过滤。
  • 误导性结果主要由不完整查询(如缺少上下文如“couldn't lift”)、解析错误(如错误地将“lift”标记为动词)以及噪声或不完整的片段引起。
  • 该框架表明,关于可信度的一般性世界知识在自然语言文本中隐式编码,并可有效用于推理任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。