[论文解读] ChatKBQA: A Generate-then-Retrieve Framework for Knowledge Base Question Answering with Fine-tuned Large Language Models
ChatKBQA 提出了一种新颖的‘先生成后检索’知识库问答(KBQA)框架,首先使用微调过的大型语言模型(LLMs),如 Llama-2 和 Baichuan2,生成逻辑形式,然后通过无监督语义检索检索并替换实体和关系。该方法在 WebQSP 和 ComplexWebQuestions 数据集上实现了最先进性能,相较于传统的‘先检索后生成’方法,显著提升了检索效率并减少了错误传播。
Knowledge Base Question Answering (KBQA) aims to answer natural language questions over large-scale knowledge bases (KBs), which can be summarized into two crucial steps: knowledge retrieval and semantic parsing. However, three core challenges remain: inefficient knowledge retrieval, mistakes of retrieval adversely impacting semantic parsing, and the complexity of previous KBQA methods. To tackle these challenges, we introduce ChatKBQA, a novel and simple generate-then-retrieve KBQA framework, which proposes first generating the logical form with fine-tuned LLMs, then retrieving and replacing entities and relations with an unsupervised retrieval method, to improve both generation and retrieval more directly. Experimental results show that ChatKBQA achieves new state-of-the-art performance on standard KBQA datasets, WebQSP, and CWQ. This work can also be regarded as a new paradigm for combining LLMs with knowledge graphs (KGs) for interpretable and knowledge-required question answering. Our code is publicly available.
研究动机与目标
- 解决传统 KBQA 流程中依赖早期检索所导致的效率低下问题。
- 通过将逻辑形式生成与检索解耦,降低多阶段 KBQA 处理的复杂性。
- 利用微调后的开源 LLM 的推理与生成能力,实现更准确的逻辑形式构建。
- 通过在结构化逻辑形式上而非非结构化自然语言问题上执行检索,提升检索效率。
- 构建一种即插即用的框架,支持灵活替换 LLM、微调方法和检索模型。
提出的方法
- 使用指令微调对开源 LLM(如 Llama-2、Baichuan2、ChatGLM2)进行微调,使其能够从问题中生成逻辑形式。
- 在问题中对实体和关系进行掩码,生成骨架,使模型能够学习一致的逻辑形式结构。
- 推理阶段使用束搜索(beam search)生成候选逻辑形式,在测试问题上实现了与真实答案 74% 的精确匹配率。
- 使用 SimCSE、Contriever 或 BM25 等无监督短语级语义检索方法,对生成的逻辑形式中的实体和关系进行检索与替换。
- 将生成的逻辑形式中的占位符替换为检索到的实体和关系,形成有效的 SPARQL 类查询。
- 通过支持组件互换实现即插即用集成:包括 LLM、高效微调方法(如 LoRA、QLoRA、P-Tuning v2)以及检索模型。
实验结果
研究问题
- RQ1‘先生成后检索’框架在准确率和效率方面是否优于传统的‘先检索后生成’KBQA 方法?
- RQ2在不依赖先前检索的情况下,微调后的 LLM 能在多大程度上生成准确的逻辑形式?
- RQ3在生成的逻辑形式上执行检索,其效率与在原始自然语言问题上执行检索相比如何?
- RQ4该框架是否能在不同 LLM、微调策略和检索模型下保持高性能?
- RQ5即插即用的设计是否支持在不同硬件和模型配置下灵活且可扩展地部署?
主要发现
- 在 WebQSP 基准测试中,ChatKBQA 使用 Llama-2-13B 搭配 LoRA 微调和 SimCSE 检索,实现了 82.6% 的 F1 值、85.2% 的 Hits@1 和 77.5% 的准确率,创下新最先进性能。
- 在 ComplexWebQuestions(CWQ)数据集上,使用 Llama-2-13B 搭配 LoRA 和 Contriever 检索,框架实现了 81.5% 的 F1 值、83.6% 的 Hits@1 和 76.8% 的准确率。
- 约 74% 的生成逻辑形式与真实答案完全匹配,且在掩码实体和关系后,超过 91% 的形式保持了正确的结构格式。
- 在‘先生成后检索’设置中,检索效率显著提升:实体和关系检索的语义相似度分数在 AG-R(生成后)始终高于 NL-R(从自然语言中检索),尤其在关系检索方面更为明显。
- 即插即用设计支持灵活的组件替换——例如,将 LLM 从 Baichuan2-7B 替换为 Llama-2-13B,或将检索模型从 SimCSE 替换为 BM25——同时在各类变体中保持强大性能。
- 该框架展现出良好的鲁棒性与可扩展性,当升级 LLM、微调方法(如 QLoRA)或检索模型时,性能均有可观提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。