Skip to main content
QUICK REVIEW

[논문 리뷰] Minimizing Factual Inconsistency and Hallucination in Large Language Models

I Muneeswaran, Shreya Saxena|arXiv (Cornell University)|2023. 11. 23.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 최종 답변을 생성하기 전에 추론 과정을 생성하고 검증하며 개선하는 다단계 프레임워크를 제안한다. 이는 대규모 언어 모델에서 사실 오류와 환각 현상을 크게 감소시킨다. 생물의학 분야의 약물 관련 질의에서 표준 RAG 대비 신뢰성은 14–25% 향상되고 정확도는 16–22% 향상되며, 미세조정된 Llama2-7B는 비미세조정 버전보다 정확도가 33–42% 높다.

ABSTRACT

Large Language Models (LLMs) are widely used in critical fields such as healthcare, education, and finance due to their remarkable proficiency in various language-related tasks. However, LLMs are prone to generating factually incorrect responses or "hallucinations," which can lead to a loss of credibility and trust among users. To address this issue, we propose a multi-stage framework that generates the rationale first, verifies and refines incorrect ones, and uses them as supporting references to generate the answer. The generated rationale enhances the transparency of the answer and our framework provides insights into how the model arrived at this answer, by using this rationale and the references to the context. In this paper, we demonstrate its effectiveness in improving the quality of responses to drug-related inquiries in the life sciences industry. Our framework improves traditional Retrieval Augmented Generation (RAG) by enabling OpenAI GPT-3.5-turbo to be 14-25% more faithful and 16-22% more accurate on two datasets. Furthermore, fine-tuning samples based on our framework improves the accuracy of smaller open-access LLMs by 33-42% and competes with RAG on commercial models.

연구 동기 및 목표

  • 의료 및 약물 안전성 감시와 같은 고위험 분야에서 대규모 언어 모델(LLM)의 사실 오류와 환각 현상이라는 핵심 문제를 해결하기 위해.
  • 추론 생성과 출처 참조를 통합함으로써 LLM이 생성한 응답의 투명성과 추적 가능성을 향상시키기 위해.
  • 모델의 응답이 정제된 지식 저장소와 검증 가능한 자료에 기반해야 하는 산업 응용 분야에서의 신뢰성 향상을 위해.
  • 프레임워크가 생물의학 질문-답변 과제에서 표준 RAG보다 훨씬 높은 허구성과 정확도를 보임을 입증하기 위해.
  • 프레임워크의 출력 데이터를 사용해 소규모 오픈소스 LLM을 미세조정하면 상용 모델의 RAG 성능과 유사한 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 최종 답변을 생성하기 전에 추론 과정을 단계별로 생성함으로써 논리적 흐름과 사실 기반을 확보한다.
  • 틀린 또는 일관되지 않은 추론 요소를 탐지하고 수정하기 위해 추론 검증기와 개선기 기능을 포함한다.
  • 다듬어진 추론을 최종 답변 생성의 지원 근거로 사용함으로써 추적 가능성과 신뢰도를 향상시킨다.
  • PubMed, 내부 데이터베이스 등 사실 기반으로 정제된 지식 소스에서의 검색을 통해 추론과 답변를 기반화한다.
  • 프레임워크는 두 가지 데이터셋을 사용해 평가되었다: PubmedQA(공개) 및 AEQA(내부 데이터, 약물 부작용 전문가가 정제한 자료).
  • 프레임워크의 출력 데이터를 사용해 소규모 오픈소스 모델(예: Llama2-7B)을 미세조정함으로써 성능 향상을 도모한다.

실험 결과

연구 질문

  • RQ1추론 검증 및 개선 기능을 포함한 다단계 추론 프레임워크가 LLM에서 사실 오류와 환각 현상을 줄일 수 있는가?
  • RQ2생물의학 질문-답변 과제에서 제안된 프레임워크는 표준 RAG 대비 허구성과 정확도에서 어떻게 비교되는가?
  • RQ3프레임워크의 출력 데이터를 사용해 소규모 오픈소스 LLM을 미세조정하면 비미세조정 버전 대비 성능 향상이 얼마나 이루어지는가?
  • RQ4전체 문단 대신 구조화된 삼항 조합을 입력으로 사용할 경우, 맥락 길이를 줄일 수 있는가, 성능 저하 정도는 어떠한가?
  • RQ5특정 지식 소스로의 답변 추적 가능성을 높여 투명성을 향상시킬 수 있는가?

주요 결과

  • PubmedQA 데이터셋에서 프레임워크는 RAG 대비 허구성을 14.1% 향상시키고 정확도를 15.82% 향상시켰다.
  • 내부 AEQA 데이터셋에서 프레임워크는 RAG 대비 허구성을 25.04% 향상시키고 정확도를 21.66% 향상시켰다.
  • 프레임워크의 출력 데이터로 훈련한 미세조정된 Llama2-7B 모델은 비미세조정 버전 대비 정확도가 33–42% 높았다.
  • 전체 문단 검색을 사용한 RAG + FE 변형은 96.85%의 정확도와 83.24%의 허구성을 기록하여 모든 아블레이션 변형을 앞섰다.
  • 추론 검증기와 개선기 구성 요소가 크게 기여하였으며, 이들을 제거할 경우 정확도는 93.78%로 떨어지고 허구성은 80.26%로 감소했다.
  • 문단 대신 삼항 조합을 사용할 경우 입력 토큰 길이가 6.5배 줄었지만, 허구성(76.96%)과 정확도(91.27%)는 문단 기반 입력에 비해 낮았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.