[논문 리뷰] Assessing the Reliability of Large Language Model Knowledge
이 논문은 다양한 프롬프트와 맥락에서 출력 확률 분포의 일관성을 측정함으로써 대규모 언어 모델(Large Language Models, LLMs)의 사실적 신뢰성을 평가하는 새로운 메트릭인 MONITOR를 제안한다. 이 메트릭은 정확도와 강한 상관관계(피어슨 상관계수 0.846)를 보이며, 계산 비용을 2.97배 감소시켰고, 사실 지식 평가를 위한 공개된 FKTC 데이터셋도 함께 제공한다.
Large language models (LLMs) have been treated as knowledge bases due to their strong performance in knowledge probing tasks. LLMs are typically evaluated using accuracy, yet this metric does not capture the vulnerability of LLMs to hallucination-inducing factors like prompt and context variability. How do we evaluate the capabilities of LLMs to consistently produce factually correct answers? In this paper, we propose MOdel kNowledge relIabiliTy scORe (MONITOR), a novel metric designed to directly measure LLMs' factual reliability. MONITOR computes the distance between the probability distributions of a valid output and its counterparts produced by the same LLM probing the same fact using different styles of prompts and contexts.Experiments on a comprehensive range of 12 LLMs demonstrate the effectiveness of MONITOR in evaluating the factual reliability of LLMs while maintaining a low computational overhead. In addition, we release the FKTC (Factual Knowledge Test Corpus) test set, containing 210,158 prompts in total to foster research along this line (https://github.com/Vicky-Wil/MONITOR).
연구 동기 및 목표
- 다양한 프롬프트와 맥락에서 LLM 정확도 메트릭의 불안정성을 해결하고, 환각 현상에 대한 취약성을 파악하지 못하는 문제를 해결하기 위해.
- 출력 확률 분포를 분석함으로써 LLM의 사실 지식에 대한 불확실성을 캡처하는 고해상도 메트릭을 개발하기 위해.
- 다양한 모델에서 프롬프트 프레임워크와 맥락 간섭의 병합 효과가 LLM 신뢰성에 미치는 영향을 평가하기 위해.
- 높은 신뢰성 평가 정밀도를 유지하면서 사실 지식 평가의 계산 오버헤드를 줄이기 위해.
- LLM의 사실적 신뢰성에 대한 재현 가능한 연구를 지원하기 위해 210,158개의 프롬프트를 포함한 FKTC 데이터셋을 공개하기 위해.
제안 방법
- MONITOR는 동일한 사실을 다양한 프롬프트 스타일과 맥락 입력으로 탐색했을 때의 출력 확률 분포 간 거리를 계산한다.
- Jensen-Shannon 발산(JSD)을 사용하여 확률 분포의 이탈을 정량화하고, 사실적 신뢰성의 대체 지표로 활용한다.
- 이 방법은 질문 응답(QA), 단어 예측(WP), 사실 확인(FC)의 세 가지 작업에서 LLM을 평가한다.
- 통합 기울기(gradient)를 적용하여 모델 출력을 입력 특징에 기여도를 할당하고, 맥락 간섭 영향을 분석한다.
- 완전한 정확도 평가에 비해 GPU 시간의 1/3만을 사용하여 MONITOR를 계산함으로써 확장 가능한 평가가 가능해진다.
- LLaMA-30b-ins 및 BLOOMZ 시리즈를 포함한 크기와 지시 프롬프트 파인튜닝 상태가 다른 12개의 LLM에서 프레임워크를 검증하였다.
실험 결과
연구 질문
- RQ1다양한 프롬프트 조건에서 MONITOR가 표준 정확도 메트릭과 얼마나 상관관계가 있는가?
- RQ2완전한 정확도 기반의 신뢰성 평가에 비해 MONITOR는 얼마나 계산 비용을 절감하는가?
- RQ3프롬프트 프레임워크와 맥락 간섭은 LLM의 사실적 출력 일관성에 어떤 영향을 미치는가?
- RQ4크기가 큰 LLM이 스케일 법칙에 따라 MONITOR로 측정했을 때 더 높은 사실적 신뢰성을 보이는가?
- RQ5다양한 프롬프트 구성에서 MONITOR가 얼마나 강건한가? 이는 다양한 프롬프트 스타일에 대한 일반화 능력을 시사한다.
주요 결과
- MONITOR는 12개의 LLM에 대해 평균 정확도와 강한 피어슨 상관계수 0.846를 보이며, 표준 평가와 높은 일치도를 보임을 확인하였다.
- 완전한 정확도 평가에 비해 MONITOR를 사용할 경우 GPU 시간을 2.97배 절감하여 뚜렷한 계산 비용 절감 효과를 얻었다.
- 통합 기울기 기반 기여도 분석을 통해 MONITOR 값이 낮은 모델(예: OPT-2b7의 경우 0.471)은 맥락 간섭에 덜 민감한 것으로 나타났다.
- BLOOMZ 및 Vicuna 모델는 MONITOR 점수에서 스케일 법칙을 따르며, 더 큰 모델일수록 20개의 테스트 데이터셋에서 일관되게 낮은 MONITOR 값을 보이며 더 높은 신뢰성을 확보하였다.
- 다양한 프롬프트 조합에서도 MONITOR 결과는 일관되며, 7개 프롬프트와 4개 프롬프트의 하위집합 간 강한 선형 상관관계(r ≈ 0.95)를 보였다.
- 210,158개의 프롬프트를 포함한 FKTC 데이터셋이 공개되어 LLM의 사실적 신뢰성 평가의 재현 가능성을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.