[논문 리뷰] Overview of the CLEF-2021 CheckThat! Lab Task 2 on detecting previously fact-checked claims in tweets and political debates
이 논문은 2021년 CLEF-2021 CheckThat! 랩을 제시하며, 세 가지 과제를 포함하는 多국어 사실 확인 평가를 수행한다: 트윗에서 확인이 필요한 주장을 식별하는 과제 1, 확인된 바가 있는 주장을 검색하여 검증에 활용하는 과제 2, 뉴스 기사에서 가짜 뉴스를 탐지하고 주제 분야를 분류하는 과제 3. 연구는 트랜스포머 기반 모델을 사용하여 뛰어난 성능을 보이며, 최고의 시스템은 주장을 검증하는 데서 0.881의 매크로-F1을 기록했고, 주제 분야 분류에서는 0.905의 정확도를 달성했다.
We describe the fourth edition of the CheckThat! Lab, part of the 2021 Conference and Labs of the Evaluation Forum (CLEF). The lab evaluates technology supporting three tasks related to factuality, and it covers Arabic, Bulgarian, English, Spanish, and Turkish. Here, we present the task 2, which asks to detect previously fact-checked claims (in two languages). A total of four teams participated in this task, submitted a total of sixteen runs, and most submissions managed to achieve sizable improvements over the baselines using transformer based models such as BERT, RoBERTa. In this paper, we describe the process of data collection and the task setup, including the evaluation measures used, and we give a brief overview of the participating systems. Last but not least, we release to the research community all datasets from the lab as well as the evaluation scripts, which should enable further research in detecting previously fact-checked claims.
연구 동기 및 목표
- 다국어 소셜 미디어 및 정치적 논의에서 확인이 필요한 주장을 자동으로 탐지하는 시스템을 개발하고 평가하는 것.
- 중복된 사실 확인 작업을 방지하기 위해 이전에 확인된 주장을 검색할 수 있도록 하는 것.
- 뉴스 기사의 진술의 진위성과 주제 분야를 분류하여 전문가 라우팅 및 자동 확인을 지원하는 것.
- 아랍어, 불가리아어, 영어, 스페인어, 터키어를 포함하여 다국어 사실 확인 기술을 발전시키는 것.
- 확인 가능성 평가, 주장 검색, 가짜 뉴스 탐지의 파ipeline를 통해 인간의 사실 확인 작업을 지원하는 것.
제안 방법
- 과제 1은 BERT, RoBERTa, AraBERT를 사용하여 다국어 입력을 처리하는 랭킹 모델을 활용해 코로나19 및 정치 주제의 트윗에 대한 확인 가능성 예측을 수행한다.
- 과제 2는 세분화된 유사도 기반으로 목표 주장을 유사한 이전에 확인된 주장을 랭킹하는 데에 트랜스포머 모델(예: RoBERTa)을 사용한다.
- 과제 3은 트랜스포머 아키텍처(예: BERT, 앙상블 모델)를 사용하여 뉴스 기사의 진위성과 주제 분야를 다중 분류한다.
- 평가 지표로는 랭킹 과제에 대해 평균 평균 정밀도(MAP), 분류 과제에 대해 매크로-F1을 사용한다.
- 시스템 파이프라인은 주장 탐지, 증거 검색, 진위성 예측을 통합하여 반자동 사실 확인 워크플로우를 지원한다.
- 데이터셋은 실제 세계의 자료에서 구축되었으며, 트위터 스트림, 정치적 토론, 다국어 뉴스 기사가 포함되어 있다.
실험 결과
연구 질문
- RQ1트랜스포머 기반 모델은 다국어 소셜 미디어 콘텐츠에서 확인이 필요한 주장을 식별하는 데 얼마나 효과적인가?
- RQ2의미적 매칭을 통해 이전에 확인된 주장을 얼마나 잘 검색할 수 있는가?
- RQ3다중 분류 가짜 뉴스 탐지 모델은 뉴스 기사의 진위성과 주제 분야를 정확하게 예측할 수 있는가?
- RQ4아랍어, 영어, 불가리아어, 스페인어, 터키어 등 다양한 언어에서 사실 확인 과제의 성능는 어떻게 달라지는가?
- RQ5앙성 모델과 미세조정된 트랜스포머의 성능 향상은 주장 검증 및 주제 분야 분류 정확도에 어떤 영향을 미치는가?
주요 결과
- 과제 2(이전에 확인된 주장을 검색하는 과제)에서 가장 우수한 시스템은 트랜스포머 모델 3종의 앙상블을 사용해 매크로-F1 점수 0.881을 기록했다.
- 과제 3B(주제 분야 분류)에서 최고의 팀(NITK_NLP)은 매크로-F1 0.881과 정확도 0.905를 기록했으며, 각 분류의 F1 점수도 높았다(예: 기후 분야 0.950, 건강 분야 0.946).
- 과제 3B에서 두 번째로 우수한 시스템(NoFake)은 매크로-F1 0.855를 기록했으며, 범죄(0.875) 및 교육(0.957) 등 다양한 분야에서 뛰어난 성능을 보였다.
- 과제 1은 BERT 및 RoBERTa 모델에서 뛰어난 성능를 보였으며, 영어 및 아랍어에서 특히 두드러졌다. 최고의 시스템은 AraBERT와 다국어 BERT를 활용했다.
- 과제 3A(가짜 뉴스 탐지)는 전체적으로 낮은 성능를 보였으며, 최고의 시스템도 매크로-F1 0.841을 기록해 진짜 뉴스와 가짜 뉴스를 구분하는 데 어려움이 있음을 시사했다.
- 이 랩에는 총 132개의 팀이 등록되었으며, 과제 1, 2, 3에 각각 15개, 5개, 25개의 공식 제출이 이루어져 CLEF-2021 랩 중 가장 인기 있는 랩이 되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.