Skip to main content
QUICK REVIEW

[論文レビュー] Investigating the Role of Prompting and External Tools in Hallucination Rates of Large Language Models

Liam Barkley, Brink van der Merwe|arXiv (Cornell University)|Oct 25, 2024
Mental Health Research Topics被引用数 4
ひとこと要約

本稿は、GSM8K、TriviaQA、MMLUベンチマークにおいて、大規模言語モデル(LLM)の幻覚を低減するためのプロンプト戦略およびツール拡張型LLMエージェントを実証的に評価している。シンプルなプロンプト技術、特にサンプリングと投票(SC)が、複雑なフレームワークを上回ることを明らかにした。また、外部ツール、特に弱いモデルでは、誤ったツール使用のため幻覚率が上昇し、追加機能にもかかわらず信頼性が損なわれる傾向があることが示された。

ABSTRACT

Large Language Models (LLMs) are powerful computational models trained on extensive corpora of human-readable text, enabling them to perform general-purpose language understanding and generation. LLMs have garnered significant attention in both industry and academia due to their exceptional performance across various natural language processing (NLP) tasks. Despite these successes, LLMs often produce inaccuracies, commonly referred to as hallucinations. Prompt engineering, the process of designing and formulating instructions for LLMs to perform specific tasks, has emerged as a key approach to mitigating hallucinations. This paper provides a comprehensive empirical evaluation of different prompting strategies and frameworks aimed at reducing hallucinations in LLMs. Various prompting techniques are applied to a broad set of benchmark datasets to assess the accuracy and hallucination rate of each method. Additionally, the paper investigates the influence of tool-calling agents (LLMs augmented with external tools to enhance their capabilities beyond language generation) on hallucination rates in the same benchmarks. The findings demonstrate that the optimal prompting technique depends on the type of problem, and that simpler techniques often outperform more complex methods in reducing hallucinations. Furthermore, it is shown that LLM agents can exhibit significantly higher hallucination rates due to the added complexity of external tool usage.

研究の動機と目的

  • 異なるプロンプト戦略が多様な自然言語処理タスクにおける幻覚率に与える影響を調査すること。
  • 外部ツール(例:検索、Pythonインタプリタ)をLLMエージェントに統合した場合の幻覚頻度への影響を評価すること。
  • エージェントアーキテクチャが、複雑なツール管理による新たな幻覚を引き起こすかどうかを特定すること。
  • ブラックボックス型プロンプト技術とツール拡張型エージェントの性能を、標準化されたベンチマーク上でベースライン戦略と比較すること。
  • 有効なプロンプトおよびツール使用パターンを特定することで、信頼性の高いLLMアプリケーションの展開に役立つ実用的知見を提供すること。

提案手法

  • Chain-of-Thought (CoT)、Self-Consistency (SC)、Chain-of-Verification (CoV)、Correctness-Promoting (CP) といったさまざまなプロンプト戦略を、3つのベンチマークデータセットに適用した。
  • Wikipedia や DuckDuckGo といった外部ツールを活用するためのツール拡張型エージェントアーキテクチャ(例:ReAct、DDGA)を実装した。
  • 再現性を確保し、より小さな性能のモデルでのパフォーマンスを評価するため、ベースとなるLLMに8BパラメータのLLaMA 3.1を使用した。
  • GSM8K、TriviaQA、MMLU データセットにおけるゴールスタンダードの正解と比較することで、幻覚率を評価した。
  • 正解率と幻覚頻度を測定し、成功度を評価した。ツール使用状況は、成功および失敗したツールコールのログによって記録した。
  • すべてのプロンプトおよびエージェントフレームワークとの比較のため、プロンプトやツール使用なしの制御戦略をベースラインとして用いた。

実験結果

リサーチクエスチョン

  • RQ1どのようなNLPタスク(例:数学、トリビア、マルチドメイン推論)においても、幻覚率を最小化するプロンプト戦略は何か?
  • RQ2標準的なプロンプトやベースライン推論と比較して、LLMエージェントに外部ツールを統合することは幻覚率にどのように影響するか?
  • RQ3エージェントアーキテクチャの複雑さ(例:ReAct、DDGA)が、ツールコールの誤管理によって幻覚率を上昇させるのか?
  • RQ4ツール拡張型エージェントはどれほど正確性を向上させるのか?また、どのような条件下で性能が低下するのか?
  • RQ5ユーザーがツールの結果を補足する(例:DDGA)ことで、LLMが駆動するツール使用(例:ReAct)よりも幻覚を効果的に低減できるのか?

主な発見

  • 数学的推論タスク(GSM8K)において、複数の回答をサンプリングし、多数決で答えを選択するSelf-Consistency (SC) プロンプト戦略が、最も低い幻覚率を達成した。
  • 回答が矛盾する場合には回答を控えるCorrectness-Promoting (CP) 戦略は、回答カバレッジと幻覚低減の両面で良好なバランスを示した。
  • DuckDuckGoを統合したReActエージェント(ReAct-DDG)は、TriviaQAで制御戦略を上回る精度を達成できず、複雑なエージェントアーキテクチャが性能を悪化させる可能性があることを示した。
  • ユーザーがLLMプロンプトにDuckDuckGoの検索結果を補足するDDGAプロンプト戦略は、TriviaQAでその制御ベースラインを顕著に上回った。これは、ユーザー補足型のリトリーブがLLM駆動型ツール使用よりも信頼性が高いことを示唆している。
  • チェーンアーキテクチャエージェントは、すべてのベンチマークで制御戦略よりも高い幻覚率を示した。特にRiza PythonインタプリタとWikipediaツールが最も頻繁に呼び出されたが、失敗率も高かった。
  • ツール使用はしばしば効果的ではなかった。特にMMLUデータセットでは、Pythonインタプリタのコールが30%以上失敗しており、小型モデルにおけるツール起動の信頼性の低さが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。