[논문 리뷰] ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence
이 논문은 검색 증강 생성(RAG) 시스템에서 대규모 언어 모델(LLM)의 내부 지식 사전과 외부로 검색된 증거 사이의 긴장을 정량화하는 프레임워크인 ClashEval을 소개한다. 저자들은 참조 문서에 점점 더 잘못된 값으로 체계적으로 변형을 가하면서, LLM의 내부 사전 지식이 약할 경우 잘못된 RAG 내용을 더 자주 수용하는 반면, 사전 지식이 강할 경우 잘못된 정보에 저항한다는 것을 보여주며, RAG의 신뢰성에 있어 핵심적인 상충관계가 있음을 드러낸다. 이는 본질적으로 사실적 정확성이 보장된다는 가정에 도전한다.
Retrieval augmented generation (RAG) is frequently used to mitigate hallucinations and provide up-to-date knowledge for large language models (LLMs). However, given that document retrieval is an imprecise task and sometimes results in erroneous or even harmful content being presented in context, this raises the question of how LLMs handle retrieved information: If the provided content is incorrect, does the model know to ignore it, or does it recapitulate the error? Conversely, when the model's initial response is incorrect, does it always know to use the retrieved information to correct itself, or does it insist on its wrong prior response? To answer this, we curate a dataset of over 1200 questions across six domains (e.g., drug dosages, Olympic records, locations) along with content relevant to answering each question. We further apply precise perturbations to the answers in the content that range from subtle to blatant errors. We benchmark six top-performing LLMs, including GPT-4o, on this dataset and find that LLMs are susceptible to adopting incorrect retrieved content, overriding their own correct prior knowledge over 60% of the time. However, the more unrealistic the retrieved content is (i.e. more deviated from truth), the less likely the model is to adopt it. Also, the less confident a model is in its initial response (via measuring token probabilities), the more likely it is to adopt the information in the retrieved content. We exploit this finding and demonstrate simple methods for improving model accuracy where there is conflicting retrieved content. Our results highlight a difficult task and benchmark for LLMs -- namely, their ability to correctly discern when it is wrong in light of correct retrieved content and to reject cases when the provided content is incorrect.
연구 동기 및 목표
- 정확한 외부 증거가 제공되었을 때 RAG 시스템이 LLM의 환각 현상을 신뢰성 있게 수정하는지 조사하기 위해.
- LLM이 잘못되거나 변형된 검색된 정보를 탐지하고 기각할 수 있는지 검토하기 위해.
- 모델의 내부 지식 사전이 RAG에서 제공하는 내용에 대한 준거에 미치는 영향을 정량화하기 위해.
- 프롬프팅 전략이 사전 지식과 검색된 사실 사이의 균형에 어떻게 영향을 미치는지 평가하기 위해.
- GPT-4를 초월해 다양한 도메인과 LLM 아키텍처에서 이 동적 특성이 얼마나 견고한지 평가하기 위해.
제안 방법
- 저자들은 참조 문서 유무에 따라 GPT-4 및 기타 LLM에 사실 기반 질문을 제기하고, 응답 토큰의 확률을 측정한다.
- 실제 검색 오류를 시뮬레이션하기 위해 참조 문서에 점점 더 잘못된 값(예: 수치적 이질성, 카테고리 오류)을 체계적으로 삽입한다.
- 각 변형 수준에서, 수정된 문서에 맞는 응답 비율인 RAG 선호도 비율을 계산한다.
- 1200개 이상의 질문에 걸쳐, 모델의 사전 응답 확률(문맥 없이 올바른 토큰의 로그-확률)과 RAG 선호도 비율을 상관 분석한다.
- 예를 들어 '엄격하게 준수하라' 또는 '유연하게 준수하라'와 같은 프롬프팅 스타일이 사전 지식과 RAG 간의 관계 강도와 방향성에 미치는 영향을 분석한다.
- 일반화 가능성 평가를 위해 GPT-3.5와 Mistral-7B로 분석를 확장한다.

실험 결과
연구 질문
- RQ1정확한 검색된 정보가 제공되었을 때 LLM의 환각 현상이 신뢰성 있게 수정되는가, 아니면 정확한 RAG 입력이 있음에도 불구하고 모델이 여전히 실패할 수 있는가?
- RQ2모델의 내부 사전 지식 강도가 잘못된 검색된 정보를 수용하거나 기각할 가능성에 어떻게 영향을 미치는가?
- RQ3검색된 내용과 모델의 사전 지식 간의 이격 정도가 검색된 사실을 수용할 확률에 얼마나 영향을 미치는가?
- RQ4다른 프롬프팅 지시어(예: '엄격하게 준수')는 사전 지식과 RAG 증거 사이의 균형을 어떻게 조절하는가?
- RQ5이러한 역학적 특성은 다양한 도메인과 LLM 아키텍처 전반에서 일관되게 나타나는가?
주요 결과
- 정확한 참조 문서가 제공된 경우, GPT-4는 초기 환각 현상의 94%를 수정한다. 이는 이상 조건 하에서 RAG의 효과성을 확인한다.
- RAG 선호도 비율은 모델의 사전 확신과 반비례한다: 사전 확률이 10% 증가할수록 RAG 내용을 따를 가능성이 평균 2.3% 감소한다.
- 사전 지식이 약한 LLM은 특히 이격 정도가 클 경우 잘못된 변형된 RAG 내용을 수용할 가능성이 뚜렷이 높다.
- 변형 정도가 점점 커질수록 모델들은 점점 더 자신의 내부 사전 지식으로 되돌아가며, 이질적인 정보에 저항하는 경향을 보인다.
- 사전 확신과 RAG 준거 간의 반비례 관계는 여섯 개의 다양한 데이터셋에서 유지되며, GPT-3.5와 Mistral-7B에서도 재현되어 강건성을 확인한다.
- 엄격한 프롬프팅 지시어를 사용함에도 불구하고, 특히 사전 지식이 매우 확신된 경우 모델들은 여전히 내부 사전 지식에 강한 편향을 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.