[논문 리뷰] Do LLMs Know about Hallucination? An Empirical Investigation of LLM's Hidden States
이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 응답 생성 중 유추 오류(hallucination)를 인지하고 있는지 분석하기 위해 응답 생성 중 은닉 상태(hidden states)를 조사한다. LLaMA 모델에서 정답과 유추 오류 응답을 비교하는 통제된 실험 프레임워크를 사용하여, 저자는 LLMs가 진실된 응답과 위조된 응답에 대해 별개의 은닉 상태 동역학(hidden state dynamics)을 보이며, 이는 유추 오류 인지도 측정법과 학습된 정답 응답 방향을 활용한 활성도 공 ing 기법(activation engineering)을 통한 새로운 완화 전략을 도출할 수 있음을 밝혀냈다.
Large Language Models (LLMs) can make up answers that are not real, and this is known as hallucination. This research aims to see if, how, and to what extent LLMs are aware of hallucination. More specifically, we check whether and how an LLM reacts differently in its hidden states when it answers a question right versus when it hallucinates. To do this, we introduce an experimental framework which allows examining LLM's hidden states in different hallucination situations. Building upon this framework, we conduct a series of experiments with language models in the LLaMA family (Touvron et al., 2023). Our empirical findings suggest that LLMs react differently when processing a genuine response versus a fabricated one. We then apply various model interpretation techniques to help understand and explain the findings better. Moreover, informed by the empirical observations, we show great potential of using the guidance derived from LLM's hidden representation space to mitigate hallucination. We believe this work provides insights into how LLMs produce hallucinated answers and how to make them occur less often.
연구 동기 및 목표
- 은닉 표현을 분석함으로써 LLMs가 내부적으로 유추 오류를 인지하고 있는지 조사하는 것.
- 동일한 질문 조건에서 정답 응답과 유추 오류 응답을 처리할 때 은닉 상태 전이(hidden state transitions)를 비교하는 것.
- 은닉 상태 차이를 기반으로 LLM의 유추 오류 인지도를 정량화하는 측정법을 개발하는 것.
- 은닉 상태 표현에서 유도된 지침이 LLM 출력의 유추 오류를 줄이는 데 기여할 수 있는지 탐색하는 것.
- 학습된 정답 응답 방향을 활용한 활성도 공 ing 기법이 LLM의 진실된 응답 생성으로 향하도록 이끄는 효과를 평가하는 것.
제안 방법
- 동일한 질문을 공유하는 정답 응답과 유추 오류 응답을 각각 포함하는 이중 입력 실험 프레임워크를 설계한다.
- 최종 트랜스포머 레이어에서 세 가지 핵심 은닉 상태를 추출한다: s₁(질문 전용), s₂(질문 + 유추 오류 응답), s₃(질문 + 정답 응답).
- 은닉 상태 공간의 주요 방향을 특정하기 위해 주성분 분석(PCA)을 사용한다: d_corr(정답 전이 방향)와 d_halluc(유추 오류 전이 방향).
- 각 디코딩 단계에서 최종 은닉 상태에 스케일된 d_corr 벡터(α=100)를 더함으로써 활성도 공 ing 기법을 적용하여 진실된 응답으로의 유도를 시도한다.
- TruthfulQA 및 HaluEval 데이터셋에서 d_corr 오프셋이 있는지 여부에 따라 모델 출력을 비교하여 완화 효과를 평가한다.
- 은닉 상태 차이를 설명하고 인지도 측정법을 검증하기 위해 해석 가능성 기법(예: PCA, 어텐션 분석)을 사용한다.

실험 결과
연구 질문
- RQ1LLMs는 정답 응답과 유추 오류 응답을 처리할 때 다른 은닉 상태 동역학을 보이는가?
- RQ2은닉 상태 표현은 LLM의 내부적 유추 오류 인지 정도를 어느 정도 반영할 수 있는가?
- RQ3정답 응답 방향으로의 은닉 상태 전이 방향을 식별하고, 이를 모델 행동 유도에 활용할 수 있는가?
- RQ4은닉 상태에 정답 응답 전이 방향을 주입함으로써 LLM의 응답에서 유추 오류를 줄일 수 있는가?
- RQ5유추 오류 인지도 수준은 모델의 불확실성과 응답 신뢰성과 어떻게 관련되어 있는가?
주요 결과
- LLMs는 정답 응답과 유추 오류 응답을 처리할 때 유의미하게 다른 은닉 상태 전이를 보이며, 이는 내부적으로 유추 오류를 인지하고 있음을 시사한다.
- 최종 은닉 상태는 유추 오류 응답보다 정답 응답에 더 민감하게 반응하며, 이는 진실성과의 강한 내부 신호 일치를 시사한다.
- 은닉 상태 차이에서 유도된 유추 오류 인지도 측정법은 모델의 불확실성과 응답 신뢰성과 상관관계를 보인다.
- 정답 응답 전이 방향(d_corr)을 전략적으로 은닉 상태에 주입함으로써 유추 오류가 감소했으며, 테스트된 모든 예시(100%)에서 지식 기반 지표와의 일치도가 향상되었다.
- 활성도 공 ing 기법은 33%의 경우(예: 예제 #1)에서 잘못된 응답을 정답으로 전환시키는 데 성공했으며, 다른 경우에서는 응답의 간결성과 완전성도 향상되었다.
- 정답 전이와 유추 오류 전이 간의 효과 크기 차이(e_corr - e_halluc)는 중간에서 상부 트랜스포머 레이어에서 가장 두드러지며, 95% 신뢰구간에서 일관된 추세를 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.