[논문 리뷰] Retrieving Supporting Evidence for LLMs Generated Answers
이 논문은 원래 질문과 LLM이 생성한 답변을 조합한 쿼리를 사용해 코퍼스에서 지원 근거를 검색함으로써 LLM 생성 답변에 대한 단순 자기 검증 방법을 제안한다. LLM은 생성된 답변과 검색된 문장 간의 일관성을 평가하며, 환각 현상을 약 70–80%의 정확도로 탐지함으로써 잠재적인 가능성은 보여주지만 전반적인 환각 탐지에 있어서는 제한된 신뢰성을 보인다.
Current large language models (LLMs) can exhibit near-human levels of performance on many natural language tasks, including open-domain question answering. Unfortunately, they also convincingly hallucinate incorrect answers, so that responses to questions must be verified against external sources before they can be accepted at face value. In this paper, we report a simple experiment to automatically verify generated answers against a corpus. After presenting a question to an LLM and receiving a generated answer, we query the corpus with the combination of the question + generated answer. We then present the LLM with the combination of the question + generated answer + retrieved answer, prompting it to indicate if the generated answer can be supported by the retrieved answer. We base our experiment on questions and passages from the MS MARCO (V1) test collection, exploring three retrieval approaches ranging from standard BM25 to a full question answering stack, including a reader based on the LLM. For a large fraction of questions, we find that an LLM is capable of verifying its generated answer if appropriate supporting material is provided. However, with an accuracy of 70-80%, this approach cannot be fully relied upon to detect hallucinations.
연구 동기 및 목표
- LLM이 외부 증거와 대조하여 자신의 답변을 자체 검증할 수 있는지 조사하기 위해.
- BM25부터 신경 기반 QA 스택에 이르기까지 다양한 검색 방법이 LLM 기반 환각 탐지에 얼마나 효과적인지 평가하기 위해.
- 검색된 문장에서 요약된 답변을 추출하는 리더 모델을 사용할 경우 검증 정확도가 향상되는지 평가하기 위해.
- 환각 탐지 파이프라인에서 검색 효과성과 계산 효율성 간의 상호 상충 관계를 규명하기 위해.
- 모델 고유의 행동, 예를 들어 수치적 답변 처리의 어려움 등으로 인해 발생할 수 있는 접근의 한계를 탐색하기 위해.
제안 방법
- 질문에 대한 답변을 생성하도록 LLM에 지시하여 전문가처럼 행동하도록 하여 엄격한 수준을 확보하기 위해.
- 원래 질문과 LLM이 생성한 답변을 결합하여 검색을 위한 병합 쿼리를 구성하기 위해.
- BM25와 리더를 포함한 신경 기반 검색 스택을 포함한 여러 검색 방법을 사용해 MS MARCO 문장 코퍼스에서 관련 문장을 검색하기 위해.
- 원래 질문, 생성된 답변, 그리고 검색된 문장을 LLM에 제시하여 일관성 여부를 판단하도록 하기 위해.
- zero-shot 프om팅 전략을 사용하여 LLM이 자신의 답변이 검색된 증거에 의해 지지되는지 여부를 판단할 수 있는지 평가하기 위해.
- 인간이 레이블링한 환각 탐지 데이터를 사용하여 성능을 평가하고, 예측 결과를 기준값과 비교하기 위해.
실험 결과
연구 질문
- RQ1외부 코퍼스에서 검색된 지원 근거를 제공받을 경우, LLM은 환각 현상을 신뢰성 있게 자기 검증할 수 있는가?
- RQ2검색 방법의 선택(예: BM25 대비 신경 기반 리더 기반 검색)이 환각 탐지 정확도에 어떤 영향을 미치는가?
- RQ3검색된 문장에서 요약된 답변을 추출하는 리더 모델을 사용할 경우, LLM의 자체 답변 검증 능력이 향상되는가?
- RQ4쿼리 구성, 특히 질문+답변 병합 쿼리의 사용이 검색 관련성과 후속 검증에 어떤 영향을 미치는가?
- RQ5모델 고유의 행동, 예를 들어 수치적 답변 처리의 어려움 등으로 인해 자기 검증 접근의 신뢰성이 어느 정도 제한되는가?
주요 결과
- LLM은 전체적으로 약 70–80%의 환각 탐지 정확도를 달성하여, 이 방법은 유망하지만 모든 환각을 탐지하는 데에는 완전히 신뢰할 수 없음을 시사한다.
- 리더 구성 요소가 포함된 신경 기반 검색 방법은 BM25만 사용하는 것보다 일관되게 더 고품질의 답변을 생성하며, 검증 정확도를 향상시킨다.
- 개선에도 불구하고 리더 기반 검색 스택은 약 80%의 경우에서 예측 레이블을 변경하지 않아, 고정밀 응용 분야에 있어서는 한계가 있는 여유 개선 효과를 보인다.
- 수치적 답변 처리에 특히 어려움을 겪어, 정량적 환각을 다루는 데에서 핵심적인 한계를 드러낸다.
- 간단한 BM25 검색조차도 만족스러운 성능을 보여, 계산적으로 경량인 방법이 이 작업에 효과적일 수 있음을 시사한다.
- 잠재적 데이터 유출에 민감한 편이므로, MS MARCO 코퍼스가 LLM의 훈련 데이터에 포함되었을 가능성이 있어, 최상의 경우 성능이 과대평가될 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.