Skip to main content
QUICK REVIEW

[论文解读] Minimizing Factual Inconsistency and Hallucination in Large Language Models

I Muneeswaran, Shreya Saxena|arXiv (Cornell University)|Nov 23, 2023
Topic Modeling被引用 4
一句话总结

本文提出了一种多阶段框架,在生成答案之前进行推理过程的生成、验证与优化,显著减少了大语言模型中的事实性不一致和幻觉现象。该方法在生物医学问答任务中,相较于标准RAG,使忠实度提升14–25%,准确率提升16–22%;微调后的Llama2-7B模型在药物相关查询上的准确率比未微调版本高出33–42%。

ABSTRACT

Large Language Models (LLMs) are widely used in critical fields such as healthcare, education, and finance due to their remarkable proficiency in various language-related tasks. However, LLMs are prone to generating factually incorrect responses or "hallucinations," which can lead to a loss of credibility and trust among users. To address this issue, we propose a multi-stage framework that generates the rationale first, verifies and refines incorrect ones, and uses them as supporting references to generate the answer. The generated rationale enhances the transparency of the answer and our framework provides insights into how the model arrived at this answer, by using this rationale and the references to the context. In this paper, we demonstrate its effectiveness in improving the quality of responses to drug-related inquiries in the life sciences industry. Our framework improves traditional Retrieval Augmented Generation (RAG) by enabling OpenAI GPT-3.5-turbo to be 14-25% more faithful and 16-22% more accurate on two datasets. Furthermore, fine-tuning samples based on our framework improves the accuracy of smaller open-access LLMs by 33-42% and competes with RAG on commercial models.

研究动机与目标

  • 为解决大语言模型(LLMs)在医疗和药物警戒等高风险领域中事实性不一致和幻觉现象这一关键问题。
  • 通过引入推理过程生成与来源引用,提升大语言模型生成结果的透明度与可追溯性。
  • 提升大语言模型在工业应用中的可靠性,确保其回答基于经过筛选的知识库和可验证的来源。
  • 证明该框架在生物医学问答任务中,相较于标准检索增强生成(RAG)方法,在忠实度与准确率方面表现更优。
  • 表明利用该框架输出数据对小型开源大语言模型进行微调,可使其性能媲美商业模型的RAG方法。

提出的方法

  • 该框架在生成最终答案前,分步生成推理过程,确保逻辑连贯性与事实依据。
  • 包含推理过程验证器与优化器,用于检测并修正错误或不一致的推理组件。
  • 经优化的推理过程作为支持性依据,用于生成最终答案,从而提升可追溯性与可信度。
  • 该方法利用来自事实性校准知识源(如PubMed、内部数据库)的检索结果,为推理与答案提供事实基础。
  • 使用两个数据集对框架进行评估:PubmedQA(公开)与AEQA(内部,专家校准的不良药物反应数据集)。
  • 对小型开源模型(如Llama2-7B)应用微调,使用该框架生成的数据以提升性能。

实验结果

研究问题

  • RQ1是否可以通过包含推理过程验证与优化的多阶段推理框架,减少大语言模型中的事实性幻觉?
  • RQ2在生物医学问答任务中,该框架相较于标准RAG在忠实度与准确率方面表现如何?
  • RQ3利用该框架输出数据对小型开源大语言模型进行微调,能在多大程度上提升其性能,相较于未微调版本?
  • RQ4使用结构化三元组而非完整段落作为输入,是否能在不显著降低性能的前提下减少上下文长度?
  • RQ5该框架是否能通过将答案可追溯至特定知识源,提升透明度?

主要发现

  • 在PubmedQA数据集上,该框架相较于RAG,忠实度提升14.1%,准确率提升15.82%。
  • 在内部AEQA数据集上,该框架相较于RAG,忠实度提升25.04%,准确率提升21.66%。
  • 使用框架输出数据微调的Llama2-7B模型,其准确率比未微调版本高出33–42%。
  • RAG + FE变体(使用完整段落检索)实现96.85%的准确率与83.24%的忠实度,优于所有消融实验变体。
  • 推理验证器与优化器组件贡献显著,若移除则准确率降至93.78%,忠实度降至80.26%。
  • 使用三元组而非段落作为输入,可将输入token长度减少6.5倍,但导致忠实度(76.96%)与准确率(91.27%)较段落输入有所下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。