QUICK REVIEW
[论文解读] Multi-Module System for Open Domain Chinese Question Answering over Knowledge Base
Yiying Yang, Xiahui He|arXiv (Cornell University)|Oct 28, 2019
Topic Modeling参考文献 7被引用 8
一句话总结
本文提出了一种用于开放域中文知识库问答的多模块系统,结合信息检索与语义解析,以提取主题实体和关系,进而生成SPARQL查询。通过整合实体打分、基于BERT的关系排序以及基于规则的SPARQL生成,该方法在CCKS2019测试集上取得了70.45%的F1分数。
ABSTRACT
For the task of open domain Knowledge Based Question Answering in CCKS2019, we propose a method combining information retrieval and semantic parsing. This multi-module system extracts the topic entity and the most related relation predicate from a question and transforms it into a Sparql query statement. Our method obtained the F1 score of 70.45% on the test data.
研究动机与目标
- 为在训练数据有限且语言结构复杂的条件下,解决开放域中文知识库问答问题。
- 提升在中文多跳问题中实体与关系抽取的准确性。
- 结合基于检索与基于语义解析的方法,以在低资源环境下实现稳健的KBQA。
- 开发一种规则感知的SPARQL生成流水线,以处理复杂问题类型,包括两跳查询与性别/时间限制查询。
提出的方法
- 主题实体识别模块采用百度与PaddlePaddle提供的混合命名实体识别模型,并扩展以支持金融类及非标准实体类型。
- 通过五项标准对候选实体进行打分排序:长度、知识库中的出度、与疑问词的距离、字符重叠度以及与问题的词重叠度。
- 基于BERT的相似度模型对主题实体的两跳子图中的关系进行排序,并采用过采样方法缓解类别不平衡问题。
- 一个简单-复杂分类器用于区分单跳与双跳问题,以指导SPARQL查询结构的构建。
- 基于规则的SPARQL生成机制整合了性别、时间格式及双跳答案选择的约束,确保变量正确绑定。
- 在训练过程中将实体替换为<e>标记,以减少数据偏差并提升泛化能力。
实验结果
研究问题
- RQ1如何在存在歧义或多实体的开放域中文问题中有效识别主题实体?
- RQ2在两跳子图中,关系排序的最优方式是什么,以实现准确的SPARQL查询生成?
- RQ3如何结合基于检索与基于语义解析的方法,以提升低资源环境下的KBQA性能?
- RQ4哪些基于规则的策略能提升复杂问题类型(如双跳或时间约束查询)的SPARQL查询正确性?
主要发现
- 在实体打分机制中引入出度与相似度得分,使主题实体识别准确率从基线的90.3%提升至95.6%。
- 基于BERT的关系打分模型在关系排序任务中达到95.7%的准确率,显著优于RNN与CNN基线模型。
- 增加对象相似度得分与SPARQL规则后,最终答案选择在开发集上的准确率从68%提升至75%。
- 最终系统在CCKS2019测试集上实现了70.45%的F1分数,展现出在开放域中文KBQA任务中的优异性能。
- 简单-复杂分类器达到91%的准确率,实现了对查询的有效路由,分别匹配至单跳或双跳SPARQL模板。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。