[논문 리뷰] AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models
이 논문은 공공의 사실 확인 데이터셋을 활용하여 수동 주석이 필요한 비용을 제거하고 모델 전용 환각 데이터셋을 자동으로 생성하는 AutoHall을 제안한다. 또한 모델 생성 참조 내 상반된 내용을 기반으로 한 제로 리소스, 블랙박스 환각 탐지 기법을 도입하여 ChatGPT 및 Llama-2 모델에서 기존 기준 대비 20-30% 높은 F1 스코어를 달성한다.
Large language models (LLMs) have gained broad applications across various domains but still struggle with hallucinations. Currently, hallucinations occur frequently in the generation of factual content and pose a great challenge to trustworthy LLMs. However, hallucination detection is hindered by the laborious and expensive manual annotation of hallucinatory content. Meanwhile, as different LLMs exhibit distinct types and rates of hallucination, the collection of hallucination datasets is inherently model-specific, which also increases the cost. To address this issue, this paper proposes a method called $ extbf{AutoHall}$ for $\underline{Auto}$matically constructing model-specific $\underline{Hall}$ucination datasets based on existing fact-checking datasets. The empirical results reveal variations in hallucination proportions and types among different models. Moreover, we introduce a zero-resource and black-box hallucination detection method based on self-contradiction to recognize the hallucination in our constructed dataset, achieving superior detection performance compared to baselines. Further analysis on our dataset provides insight into factors that may contribute to LLM hallucinations. Our codes and datasets are publicly available at https://github.com/zouyingcao/AutoHall.
연구 동기 및 목표
- LLM의 환각 탐지 데이터셋을 위한 수동 주석의 높은 비용과 시간 소모 문제를 해결한다.
- 인간 레이블 없이도 모델 전용 환각 데이터셋을 자동으로 생성하고 확장 가능한 방법을 개발한다.
- 모델 내부 응답만을 기반으로 하는 제로 리소스, 블랙박스 환각 탐지 기법을 가능하게 한다.
- 다양한 LLM에서 환각의 빈도, 유형 및 분포를 조사한다.
- 모델 생성 참조 간 상반된 내용 분석을 통해 환각 탐지 성능을 향상시킨다.
제안 방법
- 기존 공공의 사실 확인 데이터셋(예: WICE, Climate-Fever, PubHealth)을 활용하여 주장과 그에 대한 참/거짓 레이블(사실적/사실이 아님)을 추출한다.
- 대상 LLM을 사용해 각 주장을 기반으로 다수의 참조를 생성하며, 이를 잠재적인 환각 또는 사실적인 응답으로 간주한다.
- 주장의 참/거짓 레이블과 일치하는지 여부에 따라 생성된 참조를 환각 또는 사실로 자동으로 레이블링한다.
- 주장과 LLM 생성 참조 및 해당 레이블을 쌍으로 묶어 모델 전용 환각 데이터셋(AutoHall)을 구성한다.
- 각 주장을 기반으로 K개의 참조를 샘플링하여, 참조 간 상반된 내용을 탐지함으로써 제로 리소스 환각 탐지 기법을 구현한다.
- 자신의 대답 간 충돌 수를 신호로 사용한다: 충돌 수가 높을수록 환각 가능성 높아짐을 의미한다.
실험 결과
연구 질문
- RQ1기존 사실 확인 데이터셋을 활용해 수동 주석 없이 모델 전용 환각 데이터셋을 자동으로 생성할 수 있는가?
- RQ2다수의 LLM 생성 참조 간 상반된 내용 탐지 기법이 환각을 식별하는 데 얼마나 효과적인가?
- RQ3ChatGPT 및 Llama-2와 같은 다양한 LLM에서 환각의 빈도와 주제 분포는 어떠한가?
- RQ4온도 및 비교 쌍 수(K)와 같은 하이퍼파라미터가 환각 탐지 성능에 미치는 영향은 어떠한가?
- RQ5제안된 방법은 기존 제로 리소스 및 외부 지식 기반 환각 탐지 기준 대비 성능에서 어떻게 비교되는가?
주요 결과
- AutoHall은 수동 주석 없이도 모델 전용 환각 데이터셋을 자동으로 생성하는 데 성공하였다.
- 제안된 상반된 내용 기반 탐지 기법은 ChatGPT 및 Llama-2 모델에서 기존 기준 대비 F1 스코어 20-30% 향상시켰다.
- 단일 참조 방법 대비 다중 참조 비교를 사용할 경우 평균적으로 환각 탐지 F1 스코어가 8.91% 향상되었다.
- 시험된 모델들에서 LLM 출력 내 환각 비율은 평균 20%에서 30% 사이로 추정된다.
- ChatGPT가 생성한 환각은 역사, 기술, 문화, 지리, 비즈니스 분야에서 가장 빈번하게 발생하며, Llama-2-chat은 정치, 스포츠, 지리 분야에서 더 자주 환각을 일으킨다.
- 환각 참조에서는 평균 충돌 수(2.75, T=0.9일 때 ChatGPT 기준)가 사실 참조(평균 1.79)보다 유의미하게 높게 나타나, 이 기법의 분류 능력이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.