Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models

Weihang Su, Changyue Wang|arXiv (Cornell University)|2024. 03. 11.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs) 추론 중 내부 상태(예: 문맥 임bedding, 어텐션, 활성화)를 활용하여 수동 애너테이션 없이 사실성 오류를 탐지하는 비지도, 실시간 환각 탐지 프레임워크인 MIND를 제안한다. MIND는 새로운 HELM 벤치마크에서 최고 성능을 기록하며 낮은 지연 시간과 기존 LLM들과의 완전한 호환성을 보이며 높은 정확도를 입증한다.

ABSTRACT

Hallucinations in large language models (LLMs) refer to the phenomenon of LLMs producing responses that are coherent yet factually inaccurate. This issue undermines the effectiveness of LLMs in practical applications, necessitating research into detecting and mitigating hallucinations of LLMs. Previous studies have mainly concentrated on post-processing techniques for hallucination detection, which tend to be computationally intensive and limited in effectiveness due to their separation from the LLM's inference process. To overcome these limitations, we introduce MIND, an unsupervised training framework that leverages the internal states of LLMs for real-time hallucination detection without requiring manual annotations. Additionally, we present HELM, a new benchmark for evaluating hallucination detection across multiple LLMs, featuring diverse LLM outputs and the internal states of LLMs during their inference process. Our experiments demonstrate that MIND outperforms existing state-of-the-art methods in hallucination detection.

연구 동기 및 목표

  • 후처리 기반 환각 탐지 방법의 한계를 해결하기 위해, 계산 비용이 높고 LLM 추론과의 통합이 어려운 점을 해결하고자 한다.
  • LLM 추론 중에만 내부 모델 상태를 사용하여 실시간, 비지도 프레임워크를 개발하여 환각을 탐지하고자 한다.
  • 생성된 출력과 내부 활성화를 포함한 다중 LLM 벤치마크인 HELM을 도입함으로써 환각 탐지 분야의 재현성과 벤치마크 품질을 향상시키고자 한다.
  • 환각 탐지 모델 학습을 위해 고비용의 인간 애너테이션 데이터에 의존하지 않도록 하고자 한다.
  • 모든 트랜스포머 기반 LLM에 경량이고 호환 가능한 방식으로 환각 탐지 기능을 통합할 수 있도록 하고자 한다.

제안 방법

  • MIND는 인간 애너테이션 없이 위키백과에서 직접 가짜 학습 데이터를 추출하여 비지도 학습을 가능하게 한다.
  • 이 프레임워크는 각 토큰의 문맥 임베딩, 자기 어텐션 맵, 히든 레이어 활성화에 기반한 경량 다층퍼셉트론(Multi-Layer Perceptron, MLP) 분류기를 사용한다.
  • 환각 탐지는 LLM이 응답을 생성하는 동안 내부 상태를 분석함으로써 실시간으로 수행되며, 후처리 지연을 피한다.
  • 이 방법은 추론 중 중간 모델 상태에만 접근하면 되므로, 어떤 트랜스포머 기반 LLM과도 호환된다.
  • 프레임워크는 위키백과에서 자가지도 신호를 얻어 각 토큰의 환각 가능성 예측을 위한 엔드 투 엔드 학습을 수행한다.
  • 새로운 벤치마크인 HELM이 도입되어, 여섯 개의 LLM 출력과 그들의 전체 내부 상태(임bedding, 어텐션, 활성화)를 평가에 제공한다.

실험 결과

연구 질문

  • RQ1후처리 또는 지도 데이터 기반 애너테이션에 의존하지 않고 실시간으로 환각 탐지를 수행할 수 있는가?
  • RQ2내부 LLM 상태에만 기반한 비지도 방법이 지도 또는 후처리 기반 기준 대비 환각 탐지 성능에서 얼마나 효과적인가?
  • RQ3다양한 내부 상태(예: 어텐션, 히든 상태)가 환각 탐지 성능에 미치는 영향은 어떠한가?
  • RQ4재학습 없이도 다양한 LLM 아키텍처에 경량이고 일반적인 탐지기로 효과적으로 통합될 수 있는가?
  • RQ5분류기 깊이와 학습 데이터 크기에 따라 MIND의 성능은 어떻게 변화하는가?

주요 결과

  • MIND는 인간 애너테이션 데이터가 전혀 필요 없이 HELM 벤치마크에서 최고 성능을 기록한다.
  • 사용된 분류기의 깊이가 네 층일 때 정확도가 최고 수준인 0.7291에 도달하며, 그 이상의 깊이에서는 민감도가 매우 낮아진다.
  • 학습 데이터 포인트가 4,096개를 초과하면 성능이 정체되며, 이 이상에서는 수익 감소 현상이 나타난다.
  • 후처리 방법 대비 대규모 LLM을 사용할 경우에 비해 지연 시간을 크게 줄여 실시간 탐지가 가능하다.
  • HELM 벤치마크는 다양한 LLM 출력과 전체 내부 상태 기록을 제공하여 재현성 향상과 모델 간 비교를 위한 종합적인 평가 플랫폼를 제공한다.
  • 위키백과 데이터를 기반으로 한 비지도 사전학습을 통해 피팅 없이도 여러 LLM에 대해 강력한 일반화 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.