Skip to main content
QUICK REVIEW

[论文解读] Question Generation from a Knowledge Base with Web Exploration

Linfeng Song, Lin Zhao|arXiv (Cornell University)|Oct 12, 2016
Topic Modeling参考文献 17被引用 12
一句话总结

该论文提出了一种问题生成系统,利用网络搜索扩展知识库中由模板生成的小规模问题集,显著减少人工工作量。通过迭代地使用现有问题作为搜索查询,并选择流畅且与领域相关的候选问题,该方法生成的问题比神经机器翻译基线模型更自然、语法更正确,这一结论已通过在Freebase三元组上的人工评估得到验证。

ABSTRACT

Question generation from a knowledge base (KB) is the task of generating questions related to the domain of the input KB. We propose a system for generating fluent and natural questions from a KB, which significantly reduces the human effort by leveraging massive web resources. In more detail, a seed question set is first generated by applying a small number of hand-crafted templates on the input KB, then more questions are retrieved by iteratively forming already obtained questions as search queries into a standard search engine, before finally questions are selected by estimating their fluency and domain relevance. Evaluated by human graders on 500 random-selected triples from Freebase, questions generated by our system are judged to be more fluent than those of ewcite{serban-EtAl:2016:P16-1} by human graders.

研究动机与目标

  • 通过利用网络资源而非大规模人工标注数据,减少从知识库生成问题所需的人工劳动。
  • 与神经机器翻译方法相比,提升生成问题的流畅度与自然度。
  • 实现可扩展的、可自我更新的问题生成机制,确保随网络内容演化而保持相关性。
  • 开发一种方法,在通过搜索驱动检索扩展问题覆盖范围的同时,维持领域相关性。

提出的方法

  • 为知识库中的每个谓词创建一组手工设计的问题模板,使用占位符表示主语和宾语实体。
  • 通过将这些模板应用于知识库中的三元组,生成初始问题。
  • 通过将每个生成的问题作为标准搜索引擎(如Google)的查询,从网络中检索相关问题,实现问题扩展。
  • 系统通过迭代地使用新检索到的问题作为查询向搜索引擎发起查询,利用基于集合的追踪机制避免重复。
  • 通过语言模型与领域分类的结合,估计问题的流畅度与领域相关性,其中领域相关性通过领域特定文档聚类的词嵌入平均值与余弦相似度计算得出。
  • 最终候选集根据流畅度与相关性得分进行过滤,以生成高质量、自然流畅的问题。

实验结果

研究问题

  • RQ1网络搜索能否有效用于将知识库中一个小规模的种子问题集扩展为大规模、多样化且流畅的问题语料?
  • RQ2通过网络探索生成的问题在流畅度与自然度方面,与神经机器翻译模型生成的问题相比如何?
  • RQ3该系统能否在不依赖大量人工标注数据的前提下,实现问题生成的规模化扩展,同时保持领域相关性?
  • RQ4与传统主题建模方法相比,词嵌入在多大程度上能提升领域相关性估计的性能?

主要发现

  • 人工评分员评定本方法生成的问题在流畅度与自然度方面显著优于神经机器翻译基线模型,两项指标的平均得分均更高。
  • 在网页片段数据集上,该系统在领域分类任务中达到85.65的精确率,优于先前使用LDA或多粒度主题的方法。
  • 在自建的电动工具领域知识库上,系统从12,228个种子问题生成了20,000个扩展问题,其中绝大多数语法正确且与领域相关。
  • 该方法表明,词嵌入能比传统主题模型(如LDA)更有效地捕捉领域术语之间的语义相似性(例如“finance”与“economy”)。
  • 系统成功生成了复杂且信息丰富的提问,如“如何在没有铣刀的情况下在木头上切出凹槽”,表明其能力已超越简单事实性查询。
  • 该方法仅需极少人工投入——仅需手工设计少量问题模板——即可获得高质量结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。