Skip to main content
QUICK REVIEW

[논문 리뷰] Halo: Estimation and Reduction of Hallucinations in Open-Source Weak Large Language Models

Mohamed Elaraby, Mengyin Lu|arXiv (Cornell University)|2023. 08. 22.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 BLOOM7B와 같은 오픈소스 소형 LLM에서 환각 현상의 심각도를 평가하기 위한 경량 BlackBox 프레임워크인 HaloCheck을 제안한다. 또한 환각을 줄이기 위해 지식 주입과 선택적 티처-스터디 디스틸레이션 방법을 도입한다. 여러 환각 임계값에서 기준 모델의 미세조정보다 우수한 성능을 보이며, 지식 주입과 동적 티처 가이던스를 조합함으로써 사실적 일관성이 크게 향상됨을 입증한다.

ABSTRACT

Large Language Models (LLMs) have revolutionized Natural Language Processing (NLP). Although convenient for research and practical applications, open-source LLMs with fewer parameters often suffer from severe hallucinations compared to their larger counterparts. This paper focuses on measuring and reducing hallucinations in BLOOM 7B, a representative of such weaker open-source LLMs that are publicly available for research and commercial applications. We introduce HaloCheck, a lightweight BlackBox knowledge-free framework designed to quantify the severity of hallucinations in LLMs. Additionally, we explore techniques like knowledge injection and teacher-student approaches to alleviate hallucinations in low-parameter LLMs. Our experiments effectively demonstrate the reduction of hallucinations in challenging domains for these LLMs.

연구 동기 및 목표

  • 소형 오픈소스 LLM에서 환각 현상의 심각도를 정량화하는 데 효과적이고 자동화된 메트릭이 부족한 문제를 해결하기 위해.
  • 지시 미세조정이나 비용이 많이 드는 인간 생성 프롬프트에 의존하지 않고도 약한 LLM에 사실 지식을 강화하기 위해.
  • 더 강력한 티처 모델(예: GPT-4)이 더 약한 LLM을 효과적으로 지도할 수 있는지, 동시에 계산 비용을 최소화할 수 있는지 조사하기 위해.
  • 지식 주입과 티처-스터디 디스틸레이션 간의 상호작용이 저파rameter 모델에서 환각 현상을 줄이는 데 어떻게 기여하는지 평가하기 위해.

제안 방법

  • HaloCheck는 문장 수준의 함의 관계를 다수의 모델 생성 결과에 대해 평가하는 샘플링 기반의 BlackBox 접근 방식을 사용하여 환각 현상의 심각도를 추정한다.
  • 지식 주입은 WikiData에서 추출한 엔티티 요약문과 삼중항을 사용해 BLOOM7B를 미세조정함으로써 수행되며, 지시 미세조정 없이도 도메인 특화 사실 지식을 강화한다.
  • 티처-스터디 디스틸레이션 프레임워크는 환각 수준이 높은 경우에만 GPT-4를 선택적으로 활성화하며, 자동 CoT를 활용해 티처 출력의 추론 품질을 향상시킨다.
  • 프레임워크는 환각 심각도가 사전 정의된 수준을 초과할 경우에만 티처 참여를 유도하는 임계값 기반 전략을 사용하여 비용과 일관성의 최적화를 달성한다.
  • 모델 일관성은 도메인 특화 NBA 질문-답변 데이터셋을 사용해 평가되며, 환각 심각도는 다수의 생성 결과 간의 함의 기반 일치도로 측정된다.
Figure 1: The Halo framework is illustrated in three parts. (a) HaloCheck framework components for hallucinations estimation. (b) Knowledge injection training, which aims to reduce hallucinations by injecting abstract knowledge representations. (c) Improving student responses by stronger teacher res
Figure 1: The Halo framework is illustrated in three parts. (a) HaloCheck framework components for hallucinations estimation. (b) Knowledge injection training, which aims to reduce hallucinations by injecting abstract knowledge representations. (c) Improving student responses by stronger teacher res

실험 결과

연구 질문

  • RQ1지식 기반 없이 자동화되고 효율적인 방식으로 LLM에서 환각 현상의 심각도를 어떻게 정량화할 수 있는가?
  • RQ2지시 미세조정 없이도 지식 주입이 약한 LLM의 사실적 일관성을 향상시킬 수 있는가?
  • RQ3더 강력한 티처 LLM이 더 약한 LLM의 일관성을 향상시킬 수 있으며, 선택적 참여 방식은 계산 비용을 줄이는 데 효과적인가?
  • RQ4지식 주입과 티처-스터디 디스틸레이션은 어떻게 상호작용하여 환각 현상을 줄이는가?

주요 결과

  • HaloCheck는 기존 BlackBox 메트릭보다 환각 심각도 평가에서 뛰어난 성능을 보이며, 모델 일관성 평가에 있어 빠르고 정확한 방법을 제공한다.
  • WikiData 엔티티 요약문과 삼중항을 활용한 지식 주입은 사실적 일관성을 크게 향상시켜 모든 임계값에서 환각 현상을 감소시킨다.
  • 지식 주입과 선택적 티처 가이던스를 모두 사용한 모델은 SFT 전용 모델보다 성능이 뛰어나며, 특히 높은 환각 임계값(예: 0.2)에서 일관성 향상과 티처 쿼리 의존도 감소가 두드러진다.
  • 티처 참여를 환각 수준이 높은 경우에만 제한함으로써 더 나은 성능을 달성했으며, 이는 동적 참여 전략의 가치를 입증한다.
  • 지식 주입이 적용된 후에도 기준 임계값(0)에서 약 65%의 질문이 여전히 티처 지원이 필요함을 시사하며, 기본 모델의 지속적인 일관성 부족을 보여준다.
  • 틀린 티처의 답변은 학생 모델을 오도할 수 있으나, 티처 출력에 자동 CoT를 적용함으로써 더 구체적인 추론 과정을 제공해 이러한 오류를 완화할 수 있다.
Figure 2: (a) Illustrates the enhancement in HaloCheck based on varying the threshold across different levels of inconsistency. The $--$ lines indicate calling the teacher consistently for every question. (b) Shows the percentage of calls made to the teacher model in relation to the total number of
Figure 2: (a) Illustrates the enhancement in HaloCheck based on varying the threshold across different levels of inconsistency. The $--$ lines indicate calling the teacher consistently for every question. (b) Shows the percentage of calls made to the teacher model in relation to the total number of

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.