Skip to main content
QUICK REVIEW

[논문 리뷰] Rowen: Adaptive Retrieval-Augmented Generation for Hallucination Mitigation in LLMs

Hanxing Ding, Liang Pang|arXiv (Cornell University)|2024. 02. 16.
Epilepsy research and treatment인용 수 4
한 줄 요약

Rowen은 다국어 편집을 통한 내부 추론의 일관성 검사를 기반으로 외부 검색을 동적으로 활성화함으로써 대규모 언어 모델(Large Language Models, LLMs)의 환각 현상을 완화하는 새로운 적응형 검색 증강 생성 프레임워크이다. 이는 기존 방법들에 비해 훨씬 적은 검색 호출 수로 최신 기술 수준의 환각 현상 완화 성능을 달성한다.

ABSTRACT

Hallucinations present a significant challenge for large language models (LLMs). The utilization of parametric knowledge in generating factual content is constrained by the limited knowledge of LLMs, potentially resulting in internal hallucinations. While incorporating external information can help fill knowledge gaps, it also introduces the risk of irrelevant information, thereby increasing the likelihood of external hallucinations. To balance the use of parametric knowledge within LLMs and external information, in this study, we present Rowen, a novel framework that enhances LLMs with an adaptive retrieval augmentation process tailored to address hallucinated outputs. Rowen introduces a consistency-based hallucination detection module, which assesses the model's uncertainty regarding the input query by evaluating the semantic inconsistencies in various responses generated across different languages or models. When high uncertainties in the responses are detected, Rowen activates the retrieval of external information to rectify the model outputs. Through comprehensive empirical experiments, we demonstrate that Rowen surpasses the current state-of-the-art in both detecting and mitigating hallucinated content within the outputs of LLMs.

연구 동기 및 목표

  • LLM에서 발생하는 내부 환각(제한된 매개변수 지식으로 인한 것)과 외부 환각(부적절한 검색으로 인한 것)이라는 이중적 과제를 해결하기 위함.
  • 필요한 경우에만 검색을 선택적으로 활성화하여 불필요한 외부 증거 주입을 최소화하는 방법을 개발하기 위함.
  • 다국어 의미 인식 기반 감지 메커니즘을 통해 LLM 출력의 사실적 일관성과 신뢰도를 향상시키기 위함.
  • 과도한 검색 호출을 줄임으로써 사실 정확성과 추론 효율성의 균형을 이루기 위함.
  • LLM 추론 과정에서 내부 매개변수 지식과 외부 증거를 조화롭게 통합할 수 있도록 하기 위함.

제안 방법

  • Rowen은 주어진 질의를 다양한 언어로 의미적으로 동일한 버전으로 편집하는 다국어 의미 인식 기반 환각 감지 모듈을 활용한다.
  • 다양한 언어로 변환된 질의들 간의 응답 일관성을 평가함으로써, 일관성의 결여는 내부 환각의 징후로 간주된다.
  • 일관성이 감지될 경우, Rowen은 관련된 외부 증거를 사용하여 출력을 수정하는 검색 증강 생성 과정을 유도한다.
  • 응답이 언어 간 일관성을 유지할 경우, 원래의 내부 추론이 그대로 유지되어 불필요한 검색을 피한다.
  • 검색이 필요한지 여부를 결정하기 위해 임계값 기반의 일관성 지표를 사용하며, 감지 민감도와 검색 비용 간의 균형을 맞춘다.
  • 내부 추론이 신뢰할 수 없을 때에만 검색을 활성화함으로써 내부 및 외부 환각을 동시에 최소화하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1RQ1: 다국어 일관성 검사는 LLM에서 내부 환각을 효과적으로 감지할 수 있는가?
  • RQ2RQ2: 일관성 감지 기반의 적응형 검색은 항상 케이블된 검색 대비 사실 정확도를 어떻게 향상시키는가?
  • RQ3RQ3: 감지 정확도와 불필요한 외부 환각의 위험을 고려할 때, 일관성 기반 검색 활성화에 최적의 임계값은 무엇인가?
  • RQ4RQ4: 편집된 질문의 수가 감지 성능과 계산 비용에 어떤 영향을 미치는가?
  • RQ5RQ5: 기존의 RAG 방법들과 비교했을 때 Rowen은 검색 효율성과 환각 현상 완화 측면에서 어떻게 다른가?

주요 결과

  • Rowen은 TruthfulQA 및 StrategyQA 벤치마크에서 최신 기술 수준의 환각 현상 완화 성능을 달성한다.
  • Rowen은 TruthfulQA에서 평균 질문당 검색 호출 수를 1.5로 줄였고, StrategyQA에서는 0.5로 유지하여, FLARE(2.1 및 3.9)와 Detect-and-Mitigate(7.2 및 5.5)를 모두 능가한다.
  • 일관성 임계값 0.6이 감지 정확도와 부적절한 외부 환각의 위험을 고려할 때 최적의 성능을 보였다.
  • 6개의 편집된 질문을 사용할 경우 거의 최적의 성능를 달성하며, 그 이상의 질문 수는 성능 향상에 미미한 기여를 보이며, 효율적인 구현이 가능하다.
  • 내부 추론이 일관성 있고 신뢰할 만할 경우 검색을 회피함으로써 외부 환각의 위험을 크게 줄였다.
  • Rowen의 적응형 메커니즘은 비교된 모든 방법들보다 적은 검색 호출 수를 기록하면서도 사실 정확도를 유지하거나 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.