Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating the Role of Prompting and External Tools in Hallucination Rates of Large Language Models

Liam Barkley, Brink van der Merwe|arXiv (Cornell University)|2024. 10. 25.
Mental Health Research Topics인용 수 4
한 줄 요약

이 논문은 GSM8K, TriviaQA, MMLU 벤치마크에서 대규모 언어모델의 환각 현상을 줄이기 위해 프롬프팅 전략과 도구 보강된 LLM 에이전트를 실증적으로 평가한다. 간단한 프롬프팅 기법, 예를 들어 샘플링 및 투표(Sampling and Voting, SC)가 더 복잡한 프레임워크보다 우수한 성능을 보였으며, 특히 약한 모델에서 외부 도구 사용이 잘못된 방식으로 이루어질 경우 환각 빈도가 증가하여 신뢰성에 악영향을 미칠 수 있음을 발견했다. 도구의 추가 기능에도 불구하고 이는 성능 저하를 초래할 수 있다.

ABSTRACT

Large Language Models (LLMs) are powerful computational models trained on extensive corpora of human-readable text, enabling them to perform general-purpose language understanding and generation. LLMs have garnered significant attention in both industry and academia due to their exceptional performance across various natural language processing (NLP) tasks. Despite these successes, LLMs often produce inaccuracies, commonly referred to as hallucinations. Prompt engineering, the process of designing and formulating instructions for LLMs to perform specific tasks, has emerged as a key approach to mitigating hallucinations. This paper provides a comprehensive empirical evaluation of different prompting strategies and frameworks aimed at reducing hallucinations in LLMs. Various prompting techniques are applied to a broad set of benchmark datasets to assess the accuracy and hallucination rate of each method. Additionally, the paper investigates the influence of tool-calling agents (LLMs augmented with external tools to enhance their capabilities beyond language generation) on hallucination rates in the same benchmarks. The findings demonstrate that the optimal prompting technique depends on the type of problem, and that simpler techniques often outperform more complex methods in reducing hallucinations. Furthermore, it is shown that LLM agents can exhibit significantly higher hallucination rates due to the added complexity of external tool usage.

연구 동기 및 목표

  • 다양한 NLP 작업에서 다양한 프롬프팅 전략이 대규모 언어모델의 환각 빈도에 미치는 영향을 조사하기 위해.
  • 외부 도구(예: 검색, 파이썬 인터프리터)를 LLM 에이전트에 통합할 경우 환각 빈도에 어떤 영향을 미치는지 평가하기 위해.
  • 에이전트 아키텍처가 복잡한 도구 관리로 인해 정확도를 향상시키는지, 아니면 새로운 환각 현상을 유발하는지 판단하기 위해.
  • 표준 벤치마크에서 블랙박스 프롬프팅 기법과 도구 보강된 에이전트의 성능을 기준 대조 전략과 비교하기 위해.
  • 효과적인 프롬프팅 및 도구 사용 패턴을 규명하여 신뢰할 수 있는 LLM 애플리케이션 구현을 위한 실질적 통찰을 제공하기 위해.

제안 방법

  • 세 가지 벤치마크 데이터셋(GSM8K, TriviaQA, MMLU)에서 대규모 언어모델에 Chain-of-Thought (CoT), Self-Consistency (SC), Chain-of-Verification (CoV), Correctness-Promoting (CP) 등의 다양한 프롬프팅 전략을 적용하였다.
  • 외부 도구(예: 위키백과, DuckDuckGo)를 사용하여 정보 검색이 가능한 도구 보강된 에이전트 아키텍처(예: ReAct, DDGA)를 구현하였다.
  • 재현 가능성 확보 및 보다 작은, 더 낮은 성능의 모델에서의 성능 평가를 위해 기반 LLM으로 8B 파라미터 LLaMA 3.1 모델을 사용하였다.
  • GSM8K, TriviaQA, MMLU 데이터셋에서 모델 출력을 기준 정답과 비교하여 환각 빈도를 평가하였다.
  • 정답률과 환각 빈도를 성공 기준으로 삼았으며, 도구 사용은 성공 및 실패한 도구 호출 기록을 통해 추적하였다.
  • 모든 프롬프팅 및 에이전트 아키텍처와 비교를 위해 프롬프팅 또는 도구 사용 없이 작동하는 제어 전략을 기준으로 하였다.

실험 결과

연구 질문

  • RQ1다양한 유형의 NLP 작업(예: 수학, 퀴즈, 다중 도메인 추론)에서 어떤 프롬프팅 전략이 환각 빈도를 최소화하는가?
  • RQ2표준 프롬프팅 또는 기준 추론 대비 LLM 에이전트에 외부 도구를 통합할 경우 환각 빈도에 어떤 영향을 미치는가?
  • RQ3에이전트 아키텍처의 복잡성(예: ReAct, DDGA)이 도구 호출의 잘못된 관리로 인해 환각 빈도를 높이는가?
  • RQ4도구 보강된 에이전트는 정확도를 어느 정도 향상시키며, 어떤 조건에서 성능이 저하되는가?
  • RQ5사용자가 도구 결과를 보강한 경우(예: DDGA)가 LLM이 도구를 제어하는 방식(예: ReAct)보다 환각을 줄이는 데 더 효과적인가?

주요 결과

  • 수학 추론 작업(GSM8K)에서 환각 빈도가 가장 낮은 Self-Consistency (SC) 프롬프팅 전략은 다수의 샘플된 응답을 취합하고 다수결 원칙에 따라 최종 답변을 선택하는 방식을 사용하였다.
  • 정답의 커버리지와 환각 감소 사이에 균형을 이룬 Correctness-Promoting (CP) 전략은 응답이 상충될 경우 답변을 하지 않는 방식을 취하였다.
  • DuckDuckGo를 사용하는 ReAct 에이전트(ReAct-DDG)는 TriviaQA에서 기준 방법 대비 정확도 향상을 이루지 못했으며, 이는 복잡한 에이전트 아키텍처가 성능을 악화시킬 수 있음을 시사한다.
  • 사용자가 LLM 프롬프트에 DuckDuckGo 결과를 보강하는 DDGA 프롬프팅 전략은 TriviaQA에서 기준 대비 유의미하게 뛰어난 성능을 보였으며, 이는 사용자 보강된 검색 방식이 LLM 기반 도구 사용보다 더 신뢰할 수 있음을 시사한다.
  • 체인 아키텍처 에이전트의 환각 빈도는 모든 벤치마크에서 기준 전략보다 높았으며, Riza 파이썬 인터프리터와 위키백과 도구가 가장 자주 호출되었지만 실패율도 높았다.
  • 도구 사용은 종종 효과적이지 않았다: 모델이 30퍼센트 이상의 경우에서 도구 호출에 실패했으며, 특히 MMLU 데이터셋에서 파이썬 인터프리터 사용 시에 두드러졌다. 이는 작은 모델에서 도구 호출의 신뢰성이 떨어짐을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.