Skip to main content
QUICK REVIEW

[论文解读] Multi-Module System for Open Domain Chinese Question Answering over Knowledge Base

Yiying Yang, Xiahui He|arXiv (Cornell University)|Oct 28, 2019
Topic Modeling参考文献 7被引用 8
一句话总结

本文提出了一种用于开放域中文知识库问答的多模块系统,结合信息检索与语义解析,以提取主题实体和关系,进而生成SPARQL查询。通过整合实体打分、基于BERT的关系排序以及基于规则的SPARQL生成,该方法在CCKS2019测试集上取得了70.45%的F1分数。

ABSTRACT

For the task of open domain Knowledge Based Question Answering in CCKS2019, we propose a method combining information retrieval and semantic parsing. This multi-module system extracts the topic entity and the most related relation predicate from a question and transforms it into a Sparql query statement. Our method obtained the F1 score of 70.45% on the test data.

研究动机与目标

  • 为在训练数据有限且语言结构复杂的条件下,解决开放域中文知识库问答问题。
  • 提升在中文多跳问题中实体与关系抽取的准确性。
  • 结合基于检索与基于语义解析的方法,以在低资源环境下实现稳健的KBQA。
  • 开发一种规则感知的SPARQL生成流水线,以处理复杂问题类型,包括两跳查询与性别/时间限制查询。

提出的方法

  • 主题实体识别模块采用百度与PaddlePaddle提供的混合命名实体识别模型,并扩展以支持金融类及非标准实体类型。
  • 通过五项标准对候选实体进行打分排序:长度、知识库中的出度、与疑问词的距离、字符重叠度以及与问题的词重叠度。
  • 基于BERT的相似度模型对主题实体的两跳子图中的关系进行排序,并采用过采样方法缓解类别不平衡问题。
  • 一个简单-复杂分类器用于区分单跳与双跳问题,以指导SPARQL查询结构的构建。
  • 基于规则的SPARQL生成机制整合了性别、时间格式及双跳答案选择的约束,确保变量正确绑定。
  • 在训练过程中将实体替换为<e>标记,以减少数据偏差并提升泛化能力。

实验结果

研究问题

  • RQ1如何在存在歧义或多实体的开放域中文问题中有效识别主题实体?
  • RQ2在两跳子图中,关系排序的最优方式是什么,以实现准确的SPARQL查询生成?
  • RQ3如何结合基于检索与基于语义解析的方法,以提升低资源环境下的KBQA性能?
  • RQ4哪些基于规则的策略能提升复杂问题类型(如双跳或时间约束查询)的SPARQL查询正确性?

主要发现

  • 在实体打分机制中引入出度与相似度得分,使主题实体识别准确率从基线的90.3%提升至95.6%。
  • 基于BERT的关系打分模型在关系排序任务中达到95.7%的准确率,显著优于RNN与CNN基线模型。
  • 增加对象相似度得分与SPARQL规则后,最终答案选择在开发集上的准确率从68%提升至75%。
  • 最终系统在CCKS2019测试集上实现了70.45%的F1分数,展现出在开放域中文KBQA任务中的优异性能。
  • 简单-复杂分类器达到91%的准确率,实现了对查询的有效路由,分别匹配至单跳或双跳SPARQL模板。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。