[论文解读] Knowledge Graph - Deep Learning: A Case Study in Question Answering in Aviation Safety Domain
本文提出了一种基于知识图谱(KG)与深度学习(DL)的混合问答(QA)系统,用于航空安全领域,将国家运输安全委员会(NTSB)事故报告整合至领域特定的知识图谱中,并结合 BERT-QA 与 GPT-3-QA 模型。该混合系统相较于仅使用 BERT-QA 的模型准确率最高提升 40.3%,相较于仅使用 KGQA 的模型准确率最高提升 29.3%,表明 KG 与 DL 在提升复杂航空安全查询问答性能方面具有互补作用。
In the commercial aviation domain, there are a large number of documents, like, accident reports (NTSB, ASRS) and regulatory directives (ADs). There is a need for a system to access these diverse repositories efficiently in order to service needs in the aviation industry, like maintenance, compliance, and safety. In this paper, we propose a Knowledge Graph (KG) guided Deep Learning (DL) based Question Answering (QA) system for aviation safety. We construct a Knowledge Graph from Aircraft Accident reports and contribute this resource to the community of researchers. The efficacy of this resource is tested and proved by the aforesaid QA system. Natural Language Queries constructed from the documents mentioned above are converted into SPARQL (the interface language of the RDF graph database) queries and answered. On the DL side, we have two different QA models: (i) BERT QA which is a pipeline of Passage Retrieval (Sentence-BERT based) and Question Answering (BERT based), and (ii) the recently released GPT-3. We evaluate our system on a set of queries created from the accident reports. Our combined QA system achieves 9.3% increase in accuracy over GPT-3 and 40.3% increase over BERT QA. Thus, we infer that KG-DL performs better than either singly.
研究动机与目标
- 为解决从大型非结构化航空文档(如 NTSB 事故报告和航空通告 ADs)中高效检索和理解复杂安全相关信息的挑战。
- 从 NTSB 事故报告中构建一个领域特定的知识图谱,以表示与飞机事故相关的实体和关系。
- 开发一种混合问答系统,结合基于 KG 的 SPARQL 查询与基于深度学习的文本抽取技术,以提升准确率。
- 在一组精心设计的自然语言问题上,评估混合系统相较于独立的 KG 与 DL QA 模型的性能表现。
提出的方法
- 使用信息抽取技术与领域特定本体,从 NTSB 事故报告中构建航空知识图谱,以表示实体(例如:飞机、飞行员、原因)与关系。
- 实现基于 KG 的 QA 模块,通过基于规则的 NL2SPARQL 流水线将自然语言问题转换为 SPARQL 查询,并从 RDF 数据库中检索答案。
- 在事故报告的原始文本上部署两种基于深度学习的 QA 模型——BERT-QA 与 GPT-3-QA,直接从非结构化文档中抽取答案。
- 通过合并两个系统返回的前 10 个答案,将 KGQA 与 DLQA 模块的输出相结合,充分利用结构化与非结构化数据处理的优势。
- 使用手工构建的问题集对系统进行评估,通过精确匹配、语义准确率与语义召回率等指标衡量性能表现。
- 采用重排序或组合框架以优化最终答案的选择,其中 GPT-3-QA 在复杂推理任务中表现更优。
实验结果
研究问题
- RQ1能否通过从 NTSB 事故报告构建的知识图谱,有效支持航空安全领域中的结构化、基于关系的问答?
- RQ2将 KG 与深度学习模型结合,相较于单独使用任一组件,能否显著提升 QA 准确率?
- RQ3BERT-QA 与 GPT-3-QA 模型在回答航空安全文档中复杂、多跳问题方面的能力差异有多大?
- RQ4NL2SPARQL 流水线存在哪些局限性,以及这些局限性如何影响基于 KG 的 QA 性能?
- RQ5混合系统是否能够克服独立 KG 与 DL QA 模块在覆盖范围与推理能力方面的局限?
主要发现
- 混合 KGQA + BERT-QA 系统相较于独立的 KGQA 模块准确率提升 7%,相较于独立的 BERT-QA 模型准确率提升 40.3%。
- 混合 KGQA + GPT3-QA 系统相较于 KGQA 准确率提升 29.3%,相较于 GPT3-QA 单独使用时准确率提升 9.3%,是性能最佳的配置。
- KGQA 模块受限于 NL2SPARQL 流水线无法处理复杂或非三元组格式的查询,例如需要多句推理的查询。
- BERT-QA 模型表现欠佳,归因于缺乏领域特定的微调,表明需要进行领域自适应的预训练。
- GPT-3-QA 模型在需要从多个段落中整合信息的多跳问题上表现不佳,凸显其在长上下文推理方面的关键局限。
- 组合系统通过融合结构化 KG 推理与非结构化文本理解的优势,优于单一组件,展现出更强的综合性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。