Skip to main content
QUICK REVIEW

[论文解读] Investigating the Role of Prompting and External Tools in Hallucination Rates of Large Language Models

Liam Barkley, Brink van der Merwe|arXiv (Cornell University)|Oct 25, 2024
Mental Health Research Topics被引用 4
一句话总结

本文通过在GSM8K、TriviaQA和MMLU基准上实证评估提示工程策略与工具增强型大语言模型智能体,以减少大语言模型中的幻觉现象。研究发现,更简单的提示技术(如SC,采样与投票)优于复杂的框架;此外,外部工具——尤其是对性能较弱的模型——往往因工具使用不当而增加幻觉率,从而削弱了其可靠性,尽管引入了额外功能。

ABSTRACT

Large Language Models (LLMs) are powerful computational models trained on extensive corpora of human-readable text, enabling them to perform general-purpose language understanding and generation. LLMs have garnered significant attention in both industry and academia due to their exceptional performance across various natural language processing (NLP) tasks. Despite these successes, LLMs often produce inaccuracies, commonly referred to as hallucinations. Prompt engineering, the process of designing and formulating instructions for LLMs to perform specific tasks, has emerged as a key approach to mitigating hallucinations. This paper provides a comprehensive empirical evaluation of different prompting strategies and frameworks aimed at reducing hallucinations in LLMs. Various prompting techniques are applied to a broad set of benchmark datasets to assess the accuracy and hallucination rate of each method. Additionally, the paper investigates the influence of tool-calling agents (LLMs augmented with external tools to enhance their capabilities beyond language generation) on hallucination rates in the same benchmarks. The findings demonstrate that the optimal prompting technique depends on the type of problem, and that simpler techniques often outperform more complex methods in reducing hallucinations. Furthermore, it is shown that LLM agents can exhibit significantly higher hallucination rates due to the added complexity of external tool usage.

研究动机与目标

  • 探究不同提示策略在多样化自然语言处理任务中对大语言模型幻觉率的影响。
  • 评估将外部工具(如搜索、Python解释器)集成到大语言模型智能体中对幻觉频率的影响。
  • 确定智能体架构是否能提升准确率,还是因复杂的工具管理而引入新的幻觉。
  • 将黑箱提示技术与工具增强型智能体与基线控制策略在标准化基准上进行对比。
  • 通过识别有效的提示与工具使用模式,为部署可靠的大语言模型应用提供可操作的见解。

提出的方法

  • 在三个基准数据集上对大语言模型应用多种提示策略——包括思维链(CoT)、自一致性(SC)、验证链(CoV)和正确性促进(CP)——进行评估。
  • 实现工具增强型智能体架构(如ReAct、DDGA),使大语言模型能够使用外部工具(如维基百科和DuckDuckGo)进行信息检索。
  • 采用8B参数的LLaMA 3.1模型作为基础大语言模型,以确保可复现性,并评估其在较小、性能较弱模型上的表现。
  • 通过将模型输出与GSM8K、TriviaQA和MMLU数据集中的标准答案进行对比,评估幻觉率。
  • 通过正确答案率和幻觉频率衡量成功程度,工具使用情况通过记录成功与失败的工具调用日志进行追踪。
  • 采用无提示或无工具使用的控制策略作为所有提示与智能体框架比较的基线。

实验结果

研究问题

  • RQ1在不同类型自然语言处理任务(如数学、常识问答、多领域推理)中,哪种提示策略能将幻觉率降至最低?
  • RQ2与标准提示或基线推理相比,将外部工具集成到大语言模型智能体中如何影响幻觉率?
  • RQ3智能体架构的复杂性(如ReAct、DDGA)是否因工具调用管理不当而导致更高的幻觉率?
  • RQ4工具增强型智能体在多大程度上提升了准确率?在何种条件下其性能会下降?
  • RQ5用户增强的工具结果(如DDGA)是否能优于大语言模型驱动的工具使用(如ReAct),从而更有效地减少幻觉?

主要发现

  • 自一致性(SC)提示策略通过聚合多个采样响应并选择多数答案,在数学推理任务(GSM8K)中实现了最低的幻觉率。
  • 正确性促进(CP)策略在不回答与响应相矛盾的内容时,实现了答案覆盖率与幻觉减少之间的良好平衡。
  • 使用DuckDuckGo的ReAct智能体(ReAct-DDG)在TriviaQA上的准确率未超过基线方法,表明复杂智能体架构可能使性能恶化。
  • DDGA提示策略——即用户在提示中加入DuckDuckGo检索结果——在TriviaQA上显著优于其基线控制组,表明用户增强的检索比大语言模型驱动的工具使用更可靠。
  • 链式架构智能体在所有基准测试中的幻觉率均高于基线策略,其中Riza Python解释器和维基百科工具被调用最多,但失败率也最高。
  • 工具使用往往低效:模型在超过30%的情况下调用失败,尤其是在MMLU数据集上使用Python解释器时,表明小型模型在工具调用可靠性方面表现较差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。