[논문 리뷰] Too Many Claims to Fact-Check: Prioritizing Political Claims Based on Check-Worthiness
이 논문은 정치적 진술을 사실 확인에 우선시하기 위해 미세튜닝된 BERT와 수작업으로 구성한 특징(예: 단어 임베딩, 품사 태그, 비교/초월 문장, 도메인 전용 논란이 되는 주제)을 결합한 BERT 기반 하이브리드 모델을 제안한다. 이 모델은 CLEF Check That! 2018에서 0.255 MAP, 2019년에는 0.176 MAP를 기록하며 기존의 모든 방법보다 뛰어난 성능을 보였다.
The massive amount of misinformation spreading on the Internet on a daily basis has enormous negative impacts on societies. Therefore, we need automated systems helping fact-checkers in the combat against misinformation. In this paper, we propose a model prioritizing the claims based on their check-worthiness. We use BERT model with additional features including domain-specific controversial topics, word embeddings, and others. In our experiments, we show that our proposed model outperforms all state-of-the-art models in both test collections of CLEF Check That! Lab in 2018 and 2019. We also conduct a qualitative analysis to shed light-detecting check-worthy claims. We suggest requesting rationales behind judgments are needed to understand subjective nature of the task and problematic labels.
연구 동기 및 목표
- 과도한 가짜 정보로 인해 사실 확인이 필요한 정치적 진술을 우선순위 정하는 문제를 해결하기 위해.
- 사람들이 가장 중요한 진술에 집중할 수 있도록 사실 확인 가능성에 따라 진술을 순위 매기는 자동화된 시스템을 개발하기 위해.
- 하이브리드 딥 러닝과 특징 엔지니어링을 활용해 기존의 최고 수준 모델보다 진술 우선순위 정하기 작업에서 성능을 향상시키기 위해.
- qualitative 분석을 통해 사실 확인 가능성 애너테이션의 주관적이고 일관되지 않은 성격을 조사하기 위해.
- 모델의 해석 가능성과 데이터 품질 향상을 위해 애너테이션 뒤의 근거를 수집할 것을 주장하기 위해.
제안 방법
- 2018년과 2019년 CLEF Check That! 데이터셋을 사용해 진술 우선순위 정하기 작업에 대해 BERT 모델을 미세튜닝한다.
- BERT의 문맥적 표현과 추가 특징(단어 임베딩, 품사 태그, 비교/초월 문장 지표, 도메인 전용 논란이 되는 주제)을 결합한다.
- BERT 예측과 공 ing된 특징의 앙상블을 기반으로 로지스틱 회귀 분류기를 훈련시켜 진술의 사실 확인 가능성에 따라 순위를 매긴다.
- 각 구성 요소의 모델 성능에 기여도를 평가하기 위해 특징 제거 실험을 수행한다.
- 모델 예측과 애너테이션을 분석하여 레이블의 주관성과 일관성 없는 점을 평가하기 위해 질적 분석을 수행한다.
- 인간의 판단 변동성을 이해하고 향후 데이터 수집을 향상시키기 위해 애너테이션에 대한 근거를 요청한다.
실험 결과
연구 질문
- RQ1과도한 가짜 정보 속에서 정치적 진술을 사실 확인에 우선순위 정하는 데 효과적으로 접근할 수 있는 방법은 무엇인가?
- RQ2수작업 특징을 BERT와 조합할 경우, 단독 모델 대비 사실 확인 가능성 순위 매기기 성능이 얼마나 향상되는가?
- RQ3주관적이고 일관되지 않은 인간의 애너테이션은 진술 우선순위 정하기 벤치마크의 신뢰성에 어떤 영향을 미치는가?
- RQ4애너테이션에 대한 근거를 수집하면 갈등을 해결하고 모델 훈련 및 평가를 향상시킬 수 있는가?
- RQ5정치적 진술에서 사실 확인 가능성에 가장 예측력 있는 특징는 무엇인가?
주요 결과
- 제안된 BERT 기반 하이브리드 모델은 CLEF Check That! 2018 테스트 컬렉션에서 평균 평균 정밀도(MAP) 0.255를 기록하며, 이는 이전의 모든 최고 수준 모델을 능가한다.
- CLEF Check That! 2019 테스트 컬렉션에서는 MAP 0.176을 기록했으며, 다시 한번 이전의 모든 방법을 뛰어넘었다.
- 특징 제거 분석 결과, BERT와 단어 임베딩가 가장 영향력 있는 특징로 나타났으며, 수작업으로 구성한 단어 목록과 도메인 전용 논란이 되는 주제도 상당한 기여를 했다.
- 질적 분석 결과, 사실 확인 가능성 애너테이션은 매우 주관적이며, 의미적으로 유사한 진술에 대해서도 일관되지 않은 레이블링이 이루어지는 것으로 나타났다.
- 미래의 시스템 개선을 위해 애너테이션의 질을 높이기 위해, 미래 시제의 진술이나 서술어가 아닌 문장까지 사실 확인 가능하다고 표시하는 문제 있는 레이블을 식별했다.
- 저자들은 애너테이션에 대한 근거를 수집하는 것이 인간의 판단 변동성을 이해하고 향후 시스템 개선에 필수적이라고 결론 내렸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.