[论文解读] UNIQORN: Unified Question Answering over RDF Knowledge Graphs and Natural Language Text
UNIQORN 提出了一种统一的问答框架,通过使用微调后的 BERT 模型检索问题相关的证据,构建动态上下文图,将 RDF 知识图谱和自然语言文本无缝整合。它采用 Group Steiner Tree 算法从嘈杂且异构的证据中提取准确答案,在零样本和微调设置下显著优于当前最先进方法——包括基于大语言模型的方法——同时提供可解释的、基于证据的溯源信息。
Question answering over RDF data like knowledge graphs has been greatly advanced, with a number of good systems providing crisp answers for natural language questions or telegraphic queries. Some of these systems incorporate textual sources as additional evidence for the answering process, but cannot compute answers that are present in text alone. Conversely, the IR and NLP communities have addressed QA over text, but such systems barely utilize semantic data and knowledge. This paper presents a method for complex questions that can seamlessly operate over a mixture of RDF datasets and text corpora, or individual sources, in a unified framework. Our method, called UNIQORN, builds a context graph on-the-fly, by retrieving question-relevant evidences from the RDF data and/or a text corpus, using fine-tuned BERT models. The resulting graph typically contains all question-relevant evidences but also a lot of noise. UNIQORN copes with this input by a graph algorithm for Group Steiner Trees, that identifies the best answer candidates in the context graph. Experimental results on several benchmarks of complex questions with multiple entities and relations, show that UNIQORN significantly outperforms state-of-the-art methods for heterogeneous QA - in a full training mode, as well as in zero-shot settings. The graph-based methodology provides user-interpretable evidence for the complete answering process.
研究动机与目标
- 解决在 RDF 知识图谱和非结构化文本等异构数据源上进行复杂事实性问答的空白。
- 克服现有问答系统将结构化与非结构化数据视为独立范式、使用不兼容方法的局限性。
- 提供一个统一框架,动态结合两类数据源的证据,同时确保答案的溯源性和可解释性。
- 通过提供透明的、基于图的推理机制与可验证证据,减少对易产生幻觉的大语言模型的依赖。
提出的方法
- 通过使用微调后的 BERT 模型从 RDF 知识图谱和文本语料库中检索与问题相关的证据,动态构建上下文图。
- 将所有证据——无论是来自三元组还是文本段落——表示为统一图中的节点,并通过边表示语义或关系连接。
- 应用 Group Steiner Tree 算法,识别连接所有必需证据组(如问题中的实体和关系)的最小子图,从而过滤噪声并聚焦于与答案相关的路径。
- 采用松弛的主语-谓语-宾语结构统一异构证据,实现在两种数据类型间的一致处理。
- 采用两阶段流水线:首先通过 BERT 进行证据检索,然后通过 Group Steiner Tree 的图推理进行答案推导。
- 通过将最终答案推导路径(即 Group Steiner Tree)作为可见子图暴露,确保可解释性,使答案与源证据相链接。
实验结果
研究问题
- RQ1统一的问答框架能否有效处理需要同时从 RDF 知识图谱和自然语言文本中获取证据的复杂问题?
- RQ2与基于文本化统一的方法相比,基于图的推理方法在保留异构证据间关键关系方面表现如何?
- RQ3在零样本和检索增强设置下,非生成式、基于图的方法在事实性问答中能否显著优于当前最先进大语言模型?
- RQ4使用 Group Steiner Tree 是否能提升答案准确性,同时保持可解释性和溯源性?
主要发现
- UNIQORN 在多个基准测试中显著优于当前最先进异构问答方法,包括在零样本设置下。
- 与会丢失复杂推理所必需的关键证据间关系的文本化统一方法相比,UNIQORN 表现更优。
- 在零样本和检索增强生成(RAG)设置下,UNIQORN 均优于两种领先的 LLM,表明即使在 LLM 可用时,该方法依然有效。
- 使用 Group Steiner Tree 使得证据路径透明且用户可解释,使答案推导过程可追溯且可信。
- 该框架通过从混合来源动态构建并修剪上下文图,成功处理涉及多个实体和关系的复杂问题。
- 由于 Group Steiner Tree 算法在选择相关子图方面的鲁棒性,该方法即使在输入证据含有显著噪声时仍能保持高准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。