Skip to main content
QUICK REVIEW

[논문 리뷰] AVeriTeC: A Dataset for Real-world Claim Verification with Evidence from the Web

Michael Schlichtkrull, Zhijiang Guo|arXiv (Cornell University)|2023. 05. 22.
Topic Modeling인용 수 7
한 줄 요약

AVeriTeC는 50개의 사실 확인 기관으로부터 수집한 4,568개의 실제 세계의 주장을 포함하는 새로운 데이터셋을 소개한다. 이 데이터셋은 웹에서 확보한 증거, 질문-답변 쌍, 그리고 판정에 대한 상세한 정당화를 포함하고 있다. 이 데이터셋은 기존의 사실 확인 벤치마크에서의 핵심적 한계—문맥 의존성, 증거 부족, 시간적 누출—을 다루기 위해 다중 라운드의 어노테이션 프로세스를 통해 개발되었으며, 상당한 이중 어노테이터 일치도(κ = 0.619)를 달성하였고, 검색 기반 증거 확보와 인라인 학습을 활용한 주장 검증을 위한 베이스라인을 제공한다.

ABSTRACT

Existing datasets for automated fact-checking have substantial limitations, such as relying on artificial claims, lacking annotations for evidence and intermediate reasoning, or including evidence published after the claim. In this paper we introduce AVeriTeC, a new dataset of 4,568 real-world claims covering fact-checks by 50 different organizations. Each claim is annotated with question-answer pairs supported by evidence available online, as well as textual justifications explaining how the evidence combines to produce a verdict. Through a multi-round annotation process, we avoid common pitfalls including context dependence, evidence insufficiency, and temporal leakage, and reach a substantial inter-annotator agreement of $κ=0.619$ on verdicts. We develop a baseline as well as an evaluation scheme for verifying claims through several question-answering steps against the open web.

연구 동기 및 목표

  • 기존의 자동 사실 확인 데이터셋에서의 비현실적인 주장, 부족한 증거 어노테이션, 시간적 데이터 누출 등의 심각한 한계를 해결하기 위해.
  • 오픈 웹에서 확보한 증거를 활용하여 실제 세계의 주장 검증을 위한 현실적이고 확장 가능한 벤치마크를 구축하기 위해.
  • 문서 정규화와 증거 충분성 검증을 통해 문맥 의존성을 줄임으로써 고품질 어노테이션을 보장하기 위해.
  • 사실 확인 데이터가 발표된 날짜 이전에 작성된 문서만을 증거로 사용하도록 제약을 두고, 훈련/검증/테스트 분할의 시간 순서를 강제함으로써 시간적 누출을 방지하기 위해.
  • 질문-답변 분해와 인간이 제공한 정당화를 통한 구조화되고 해석 가능한 검증 프레임워크를 제공하기 위해.

제안 방법

  • 사실 확인 기관 50개로부터 Google FactCheck Claim Search API를 통해 주장들을 확보하여 실제 세계의 관련성을 확보한다.
  • 다중 라운드 어노테이션 파이프라인은 주장 정규화, 질문-답변 쌍 생성, 증거 충분성 검증을 포함하여 문맥 의존성과 부족한 증거 문제를 줄인다.
  • 증거가 부족한 경우를 대비해 '블라인드' 품질 보증 단계를 도입하여 재어노테이션을 실시함으로써 강건성과 일관성을 확보한다.
  • 시간 제약 조건을 통해 주장 날짜 이전에 발표된 문서만을 증거로 사용하도록 제한하여 분할 간 시간적 누출을 제거한다.
  • Google 검색, BM25 검색, 인라인 프롬프트, 스탠스 검출 모델을 활용하여 검색 기반 베이스라인을 개발한다.
  • 어노테이터들이 정당화를 생성하여 비교, 반올림, 갈등 탐지 등의 추론 과정을 설명함으로써 가시성과 설명 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1실제 세계의 주장과 웹에서 확보한 증거를 활용하면서도 문맥 의존성을 피할 수 있는 사실 확인 데이터셋을 구성할 수 있는가?
  • RQ2반복적인 어노테이션과 품질 보증을 통해 증거 부족 문제를 어떻게 최소화할 수 있는가?
  • RQ3시간 순서와 증거 소스 제약 조건을 통해 벤치마크 데이터셋에서 시간적 누출을 어느 정도 방지할 수 있는가?
  • RQ4질문-답변 분해 기법은 자동 주장 검증의 해석 가능성과 성능을 향상시키는 데 어떤 영향을 미치는가?
  • RQ5오픈 웹 증거와 인라인 학습을 활용한 검색 기반 베이스라인의 성능은 실제 세계의 주장에 대해 어느 정도인가?

주요 결과

  • AVeriTeC는 50개의 사실 확인 기관으로부터 Google FactCheck Claim Search API를 통해 확보한 4,568개의 실제 세계의 주장으로 구성되어 있다.
  • 이 데이터셋은 각 판정에 대해 질문-답변 쌍과 상세한 정당화를 포함하고 있어, 설명 가능한 검증을 가능하게 한다.
  • 판정에 대한 이중 어노테이터 일치도는 자유 마진 가중 캬프만 카파(κ = 0.619)로 상당한 일관성을 보였다.
  • 사실 확인 기사의 정보를 활용한 주장 정규화를 통해 어노테이션 프로세스가 성공적으로 문맥 의존성을 완화하였다.
  • 다중 라운드 어노테이션과 증거가 부족한 주장에 대해 재어노테이션을 실시하는 블라인드 품질 보증 단계를 통해 증거 부족 문제가 감소하였다.
  • 사실 확인 날짜 이전에 발표된 문서만을 증거로 사용하고, 훈련/검증/테스트 분할의 시간 순서를 강제함으로써 시간적 누출을 방지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.