Skip to main content
QUICK REVIEW

[논문 리뷰] LM vs LM: Detecting Factual Errors via Cross Examination

Roi Cohen, May Hamri|arXiv (Cornell University)|2023. 05. 22.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 한 언어 모델(검사자)이 다른 언어 모델(검사 대상자)을 다중 전환 질문을 통해 심문함으로써 주장의 일관성 결함을 드러내는, 제로샷 사실성 검출 방법인 LMvLM을 제안한다. 이 방법은 여러 언어 모델과 벤치마크에서 평균 70% 이상의 오류 탐지율과 80% 이상의 정밀도를 달성하여 강력한 베이스라인을 크게 앞서며 뛰어난 성능을 보인다.

ABSTRACT

A prominent weakness of modern language models (LMs) is their tendency to generate factually incorrect text, which hinders their usability. A natural question is whether such factual errors can be detected automatically. Inspired by truth-seeking mechanisms in law, we propose a factuality evaluation framework for LMs that is based on cross-examination. Our key idea is that an incorrect claim is likely to result in inconsistency with other claims that the model generates. To discover such inconsistencies, we facilitate a multi-turn interaction between the LM that generated the claim and another LM (acting as an examiner) which introduces questions to discover inconsistencies. We empirically evaluate our method on factual claims made by multiple recent LMs on four benchmarks, finding that it outperforms existing methods and baselines, often by a large gap. Our results demonstrate the potential of using interacting LMs for capturing factual errors.

연구 동기 및 목표

  • 현대 언어 모델에서 발생하는 사실성 환각 문제를 해결함으로써 신뢰성과 사용 가능성을 높이는 데 초점 맞추기.
  • 외부 지식이나 파인튜닝에 의존하지 않고, 제로샷, 상호작용 기반의 사실 오류 탐지 방법 개발하기.
  • 언어 모델 간의 다중 전환 상호작용을 통한 자기 일관성 검사가 사실 오류를 효과적으로 드러내는지 탐색하기.
  • 이 방법의 효과성을 다양한 언어 모델과 사실 질문-답변 벤치마크에서 평가하기.
  • 검사자 언어 모델이 심문 과정에서 사용하는 전략을 분석하여 일관성 결함을 탐지하는 데 기여하는 요소 분석하기.

제안 방법

  • 이 방법은 두 개의 언어 모델을 사용한다: 하나는 주장 생성(검사 대상자), 다른 하나는 다중 전환 심문을 통해 일관성 결함 탐지(검사자).
  • 검사자는 주장의 진실성을 검증하기 위해 다양한 질문 전략을 사용한다: 재구성, 함의 검증, 분해, 증거 요청 등.
  • 상호작용은 세 단계로 진행되며, 각 단계의 프롬프트에는 이전 라운드의 맥락이 포함된다: 설정, 질문, 결론.
  • 검사자는 검사 대상자의 응답을 평가하고 원래 주장이 사실적으로 올바른지 여부에 대한 최종 판단을 내린다.
  • 동일하거나 다른 언어 모델을 사용하여 역할을 할당하는 프롬프트 엔지니어링을 통해 제로샷 설정에서 이 방법을 구현한다.
  • 이 방법은 사실적으로 잘못된 주장이 심문을 거치면 내부 모순이 드러나 일관성 없는 응답을 유도할 것이라는 가정에 기반한다.
Figure 1: An example of our LMvLM approach. The first line shows the statement made by the Examinee LLM. Then an interaction between the Examiner and Examinee takes place, and the Examiner arrives at a conclusion whether the original statement was correct or not (here it concludes that it was a fals
Figure 1: An example of our LMvLM approach. The first line shows the statement made by the Examinee LLM. Then an interaction between the Examiner and Examinee takes place, and the Examiner arrives at a conclusion whether the original statement was correct or not (here it concludes that it was a fals

실험 결과

연구 질문

  • RQ1언어 모델이 다중 전환 질문을 통해 다른 언어 모델의 주장에서 사실 오류를 효과적으로 탐지할 수 있는가?
  • RQ2검사자 언어 모델은 검사 대상자의 응답에서 일관성 결함을 드러내기 위해 어떤 유형의 질문 전략을 사용하는가?
  • RQ3LMvLM의 성능은 다양한 언어 모델과 벤치마크에서 기존의 사실성 검출 베이스라인과 비교해 어떻게 되는가?
  • RQ4논리적 모순, 예를 들어 재구성된 질문에 대해 서로 다른 답변을 내는 경우는 얼마나 사실 오류를 시사하는가?
  • RQ5왜 일부 언어 모델(예: ChatGPT)에서는 다른 모델(예: GPT-3)보다 성능이 뛰어나며, 이는 추론 능력이 어떤 역할을 하는가?

주요 결과

  • LMvLM는 다양한 벤치마크에서 평균 70% 이상의 사실 오류를 탐지하며, 정밀도는 80% 이상을 유지하여 강력한 베이스라인을 크게 앞서는 성능을 보였다.
  • 이 방법은 파인튜닝이나 외부 지식 없이도 제로샷 설정에서도 높은 탐지 성능을 달성했다.
  • 검사자 언어 모델은 종종 논리적 분해(75%의 경우, ChatGPT 기준), 함의 검증(87.5%의 정확한 탐지에서 ChatGPT 기준), 질문 재구성 전략을 사용하여 일관성 결함을 드러내었다.
  • 재구성된 질문에 대해 모순된 답변을 내는 일관성 결함은, 검사 대상자가 사실을 올바르게 말할 경우 14%의 비율로 발생하지만, 사실 오류가 있는 주장에서 탐지된 경우 50% 이상의 비율로 발생했다.
  • 실패 사례는 주로 검사 대상자가 상호 일관성이 있는 가짜 사실 집합을 생성하여 일관성 결함을 탐지하기 어렵게 만드는 데 기인해 있다.
  • ChatGPT는 심문 과정에서 논리적 분해와 함의 검증 전략을 더 많이 사용함으로써 GPT-3보다 성능이 뛰어나지 않았다.
Figure 2: The three-stage process of cross-examination between the Examiner and Examinee , where the factuality of a claim $C$ generated by Examinee is estimated by Examiner .
Figure 2: The three-stage process of cross-examination between the Examiner and Examinee , where the factuality of a claim $C$ generated by Examinee is estimated by Examiner .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.