Skip to main content
QUICK REVIEW

[论文解读] Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese

Haochun Wang, Sendong Zhao|arXiv (Cornell University)|Sep 8, 2023
Topic Modeling被引用 5
一句话总结

本文提出知识微调(knowledge-tuning)方法,将结构化中文医学知识库整合至大语言模型(LLMs)中,以减少医学场景下的幻觉现象并提升响应可靠性。通过从知识库生成医学问答对,并微调 LLM 以检索和推理此类知识,该方法在少样本和零样本设置下均实现了更高的事实准确性与一致性,相关结论已在新发布的 cMedKnowQA 数据集上得到验证。

ABSTRACT

Large Language Models (LLMs) have demonstrated remarkable success in diverse natural language processing (NLP) tasks in general domains. However, LLMs sometimes generate responses with the hallucination about medical facts due to limited domain knowledge. Such shortcomings pose potential risks in the utilization of LLMs within medical contexts. To address this challenge, we propose knowledge-tuning, which leverages structured medical knowledge bases for the LLMs to grasp domain knowledge efficiently and facilitate reliable response generation. We also release cMedKnowQA, a Chinese medical knowledge question-answering dataset constructed from medical knowledge bases to assess the medical knowledge proficiency of LLMs. Experimental results show that the LLMs which are knowledge-tuned with cMedKnowQA, can exhibit higher levels of accuracy in response generation compared with vanilla instruction-tuning and offer a new reliable way for the domain adaptation of LLMs.

研究动机与目标

  • 为解决由于领域特定知识不足导致的 LLM 生成医学响应中出现的幻觉问题,尤其是在中文医学场景下。
  • 开发一种方法,使 LLM 在训练和推理过程中能够有效访问并推理结构化医学知识库。
  • 构建一个高质量的中文医学知识问答数据集 cMedKnowQA,用于评估 LLM 在医学领域的表现。
  • 在标准指标之外,评估知识微调 LLM 的可靠性、准确性与泛化能力。
  • 证明知识微调可提升响应质量,同时提供可追溯的知识来源,增强医学 AI 应用中的可信度。

提出的方法

  • 知识微调通过提示 GPT-4 从结构化医学知识库中生成医学问答对。
  • 该方法训练 LLM 生成查询参数(关键词与属性),以便在推理过程中从外部知识库中检索相关医学事实。
  • 在推理阶段,检索到的知识被用于支撑和优化 LLM 的响应,确保事实一致性与可追溯性。
  • 该方法利用插件式医学知识功能,作为响应生成过程中的外部检索模块。
  • 采用全面的指标体系评估该方法,涵盖知识检索准确性、响应帮助性与无害性。
  • cMedKnowQA 数据集基于真实医学知识库构建,包含多样化的医学实体与属性,适用于训练与评估。

实验结果

研究问题

  • RQ1与标准指令微调相比,知识微调是否能显著减少 LLM 生成的中文医学响应中的幻觉?
  • RQ2在仅使用有限数据进行微调的情况下,知识微调在未见医学实体上的泛化能力如何?
  • RQ3在从结构化医学知识库中检索时,知识微调在多大程度上提升了响应的准确性和可靠性?
  • RQ4集成可追溯的知识来源是否增强了 LLM 生成医学建议的可信度与可解释性?
  • RQ5在标注数据稀缺的少样本场景下,知识微调的 LLM 是否能保持高性能?

主要发现

  • 在完整 cMedKnowQA 数据集上训练时,知识微调的 LLM 在医学实体生成任务中达到 86.7% 的准确率,展现出强大的知识检索与响应生成能力。
  • 即使训练集中仅包含 0.05% 的独特医学实体,模型仍保持稳健性能,证明其对未见实体具有强大的泛化能力。
  • 在少样本场景下,模型在实体生成任务中的准确率从 100 个样本时的 60.1% 提升至 200 个样本时的 80.7%,表明其具备出色的样本效率。
  • 知识微调模型在响应准确性方面优于原始指令微调模型与基线 LLM,幻觉或多余症状的生成更少。
  • 与标准 LLM 相比,该方法显著减少了错误或无依据的主张,例如不再推荐利福平用于肝胆系统结石。
  • 知识微调模型生成的响应与源知识更加一致,避免了在输入医学知识中未出现的未经验证症状的添加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。