[논문 리뷰] Measuring and Reducing LLM Hallucination without Gold-Standard Answers
FEWL은 금표준 답이 없는 설정에서의 환각 측정에 특화된 지표로, 전문가 가중치가 적용된 참조 LLM과 게으름 페널티를 사용하고, ICL 및 LF-SFT를 통한 환각 감소 방법과 CHALE 벤치마크를 포함한다.
LLM hallucination, i.e. generating factually incorrect yet seemingly convincing answers, is currently a major threat to the trustworthiness and reliability of LLMs. The first step towards solving this complicated problem is to measure it. However, existing hallucination metrics require having a benchmark dataset with gold-standard answers, i.e. "best" or "correct" answers written by humans. Such requirements make hallucination measurement costly and prone to human errors. In this work, we propose Factualness Evaluations via Weighting LLMs (FEWL), an innovative hallucination metric that is specifically designed for the scenario when gold-standard answers are absent. FEWL leverages the answers from off-the-shelf LLMs that serve as a proxy of gold-standard answers. The key challenge is how to quantify the expertise of reference LLMs resourcefully. We show FEWL has certain theoretical guarantees and demonstrate empirically it gives more accurate hallucination measures than naively using reference LLMs. We also show how to leverage FEWL to reduce hallucination through both in-context learning and supervised fine-tuning. Extensive experiment results on Truthful-QA, CHALE, and HaluEval datasets demonstrate the effectiveness of FEWL.
연구 동기 및 목표
- 금표준 답이 이용 불가능한 상황에서 LLM의 환각을 측정하는 동기를 제시한다.
- FEWL (F actualness Evaluations via Weighting LLMs)를 전문가 가중치가 부여된 프록시 기반 진실성 지표로 도입한다.
- 금표준이 누락된 상황에서 FEWL과 최적 답 사이의 이론적 보장을 제공한다.
- FEWL이 ICL(in-context learning)과 감독형 미세조정을 통해 환각을 줄이는 데 어떻게 사용될 수 있는지 보여준다.
- 금표준이 없는 설정에서 환각 연구를 촉진하기 위한 대규모 CHALE 벤치마크를 공개한다.
제안 방법
- 참조 LLM의 답을 lambda_i(x)로 가중하여 전문가 가중 진실성 점수를 계산한다. 이 lambda_i(x)는 참조 LLM이 의도적으로 잘못된(IW) 답과 수정된(CO) 답에 얼마나 동의하거나 다르게 하는지에서 도출된다.
- 같은 주제 내 인접한 질문들에서 참조 LLM의 답이 얼마나 비슷한지 평가하여 게으름 페널티를 도입하고, 피상적으로 그럴듯하지만 잘못된 응답을 페널티한다.
- 두 구성요소를 f-다이버전스의 변분 형태(예: Total-Variation)를 사용해 합산하여 FEWL을 산출한다.
- 알고리즘적 단계로는 여러 참조 LLM에 질의하고, IW/CO 답을 생성하고, lambda_i(x)를 계산하고, KNN 질문들에 대한 게으름 페널티를 계산한 뒤, f-다이버전스 형태로 결합한다.
- 금표준 답이 없더라도 FEWL이 최상의 LLM을 가장 높게 순위 매긴다는 이론적 보장을 제공한다.
실험 결과
연구 질문
- RQ1참조 LLM을 활용하여 금표준 답이 없더라도 FEWL이 환각을 신뢰성 있게 측정할 수 있는가?
- RQ2전문가 가중 참조와 게으름 페널티가 순수한(reference-based) 메트릭에 비해 환각 측정의 정확도를 향상시키는가?
- RQ3FEWL을 금표준 라벨이 없더라도 in-context learning과 감독형 미세조정을 통해 환각을 줄이는 데 사용할 수 있는가?
- RQ4FEWL이 진정한 비환각 비율과 상관관계를 가지며 LLM을 환각 경향성에 따라 올바르게 순위 매기게 하는가?
- RQ5금표준 데이터 없이 환각 메트릭을 평가하기 위한 대-scale CHALE 벤치마크를 사용하는 것이 어떤 영향을 미치는가?
주요 결과
- FEWL은 CHALE와 Truthful-QA에서 비환각 답과 환각 또는 부분 환각 답을 구분하는 데 기초선(metric)보다 우수하다.
- FEWL은 전문 지가 가중치와 게으름 페널티를 갖춘 경우 GPT-3.5 및 GPT-4를 참조 LLM으로 사용할 때 비환각 답에 대해 더 높은 점수를 산출한다.
- FEWL은 LLM들을 환각 경향성으로 정확하게 순위를 매기며 Truthful-QA의 진짜 비환각 비율과 일치한다.
- FEWL 주도형 in-context learning이 기본 ICL보다 답변 품질을 더 향상시킨다.
- FEWL로 선택된 정답을 사용한 라벨 없는 감독형 미세조정이 사전학습 기준선보다 승률을 높이고 실제 라벨링에 근접한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.