Skip to main content
QUICK REVIEW

[논문 리뷰] Overview of the CLEF-2019 Checkthat! LAB: Automatic identification and verification of claims. Task 2: Evidence and factuality

Maram Hasanain, Reem Suwaileh|Qatar University QSpace (Qatar University)|2019. 01. 01.
Data Quality and Management인용 수 17
한 줄 요약

이 논문은 CLEF-2019 CheckThat! 랩의 두 번째 판을 제시하며, 영어 주장에 대한 확인 필요성 평가와 아랍어 주장에 대한 근거 기반 사실성 검증이라는 다국어 작업 두 가지를 도입한다. 연구는 신경망과 지도 학습 분류기를 사용하여 시스템을 평가하였으며, 주장 우선순위 정하기와 사실성 예측 분야에서 최신 기술 수준의 성능을 달성하였다. 공개된 데이터셋과 평가 도구를 통해 자동 사실 확인 연구를 촉진한다.

ABSTRACT

We present an overview of the second edition of the CheckThat! Lab at CLEF 2019. The lab featured two tasks in two different languages: English and Arabic. Task 1 (English) challenged the participating systems to predict which claims in a political debate or speech should be prioritized for fact-checking. Task 2 (Arabic) asked to (A) rank a given set of Web pages with respect to a check-worthy claim based on their usefulness for fact-checking that claim, (B) classify these same Web pages according to their degree of usefulness for fact-checking the target claim, (C) identify useful passages from these pages, and (D) use the useful pages to predict the claim's factuality. CheckThat! provided a full evaluation framework, consisting of data in English (derived from fact-checking sources) and Arabic (gathered and annotated from scratch) and evaluation based on mean average precision (MAP) and normalized discounted cumulative gain (nDCG) for ranking, and F1 for classification. A total of 47 teams registered to participate in this lab, and fourteen of them actually submitted runs (compared to nine last year). The evaluation results show that the most successful approaches to Task 1 used various neural networks and logistic regression. As for Task 2, learning-to-rank was used by the highest scoring runs for subtask A, while different classifiers were used in the other subtasks. We release to the research community all datasets from the lab as well as the evaluation scripts, which should enable further research in the important tasks of check-worthiness estimation and automatic claim verification.

연구 동기 및 목표

  • 정치적 논의에서 사실 확인이 가장 필요한 주장들을 자동으로 식별하는 시스템 개발 및 평가 (확인 필요성 평가).
  • 특히 아랍어에서 웹 자료를 활용하여 자동으로 증거 확보 및 사실성 예측을 가능하게 하기.
  • 훈련 및 평가를 위한 애너테이션 데이터가 포함된 대규모 다국어 기준 테스트 벤치마크 제공.
  • 다양한 소스에서의 애너테이션을 통합하여 주장 선택의 편향을 줄이고 데이터셋의 다양성을 향상시키기.
  • 표준화된 평가 및 공동 자원을 통해 신뢰할 수 있고 증거 기반의 가짜 뉴스 탐지 시스템 개발 지원.

제안 방법

  • CheckThat! 랩은 두 가지 주요 작업을 도입하였다: Task 1(영어)는 녹음된 정치 토론과 연설을 활용한 주장 우선순위 정하기.
  • Task 2(아랍어)는 네 가지 하위 작업으로 구성된다: 유용성 기반 웹 페이지 순위 매기기, 관련성 분류, 유용한 문장 추출, 주장 진실성 예측.
  • Task 1의 데이터셋은 프레스 컨퍼런스, 연설, 토론에서 추가로 확인된 주장들을 포함하여 CT-CWC-18 데이터셋을 확장하였다.
  • Task 2의 경우, 새로운 아랍어 데이터셋을 수작업으로 정제하였으며, 주장, 확보된 웹 페이지, 네 가지 하위 작업 모두에 대한 다중 애너테이터 평가가 포함되어 있다.
  • 평가에서는 순위 매기기 작업에 대해 MAP와 nDCG를, 분류 및 사실성 예측 작업에 대해 F1 점수를 사용하였다.
  • 최고 성능을 보인 시스템은 신경망, 로지스틱 회귀, Gradient Boosting 및 Random Forests와 같은 앙상블 모델을 사용하였으며, 일부 팀은 외부 데이터를 활용하였다.
Figure 1 : Information verification pipeline with the two tasks in the CheckThat! lab: check-worthiness estimation and factuality verification.
Figure 1 : Information verification pipeline with the two tasks in the CheckThat! lab: check-worthiness estimation and factuality verification.

실험 결과

연구 질문

  • RQ1정치적 논의에서 확인이 필요한 주장들을 식별하는 데 가장 효과적인 기계 학습 모델은 무엇인가?
  • RQ2주어진 주장의 확인에 있어 웹 페이지의 유용성 기반으로 순위를 매길 수 있는 시스템의 성능은 어떠한가?
  • RQ3유용한 웹 페이지를 포함할 경우 주장의 진실성 예측 정확도는 얼마나 향상되는가?
  • RQ4웹 자료에서 제공하는 증거를 활용해 지도 학습 분류기가 주장의 사실성을 효과적으로 예측할 수 있는가?
  • RQ5다중 소스 애너테이션의 사용은 사실 확인 시스템에서 주장 선택의 신뢰성과 편향에 어떤 영향을 미치는가?

주요 결과

  • Task 1에서 최고 점수를 받은 시스템은 신경망과 로지스틱 회귀를 사용하여 주장 우선순위 정하기에서 베이스라인 모델을 능가하였다.
  • Task 2 하위 작업 A(순위 매기기)에서는 러닝-투-랭크 모델이 최고 성능을 보였으며, 이는 증거 확보의 효과성을 입증하였다.
  • 하위 작업 D(사실성 예측)에서는 사이클 2에서 F1 점수가 0.62를 기록하여 베이스라인 F1 점수 0.34를 크게 앞서며 뚜렷한 성능 향상을 보였다.
  • 외부 데이터는 텍스트 함의 구성 요소에서 네 번의 런에서 성능 향상을 이끌어내어 증거 이해에 있어 그 가치를 입증하였다.
  • 하위 작업 D의 사이클 1에 참여한 팀 수가 적어 유용한 웹 페이지의 영향이 사실성 예측에 미치는 영향을 확실하게 도출하기 어려웠다.
  • 이 랩에서는 CT19-T1(영어)와 CT19-T2(아랍어)라는 두 가지 포괄적인 데이터셋과 평가 스크립트를 공개하여 향후 자동 사실 확인 연구를 지원하였다.
Figure 3 : A zoom into the four subtasks in Task 2.
Figure 3 : A zoom into the four subtasks in Task 2.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.