Skip to main content
QUICK REVIEW

[논문 리뷰] Constraint 2021: Machine Learning Models for COVID-19 Fake News Detection Shared Task

Thomas Felber|arXiv (Cornell University)|2021. 01. 11.
Misinformation and Its Impacts참고 문헌 20인용 수 22
한 줄 요약

이 논문은 n-그램, 독해력, 감정 톤, 구두점과 같은 언어적 특징을 사용하여 코로나19 관련 소셜미디어 게시물을 가짜 또는 진실로 분류하기 위한 고전적 기계학습 접근법을 제시한다. 최고의 성능을 보인 모델은 포괄적인 사전처리 및 특징 공학을 적용한 선형 서포트 벡터 머신이며, 공유 작업에서 테스트 세트에서 95.19%의 가중 평균 F1 스코어를 기록하여 총 167개의 제출 중 80위를 기록했다.

ABSTRACT

In this system paper we present our contribution to the Constraint 2021 COVID-19 Fake News Detection Shared Task, which poses the challenge of classifying COVID-19 related social media posts as either fake or real. In our system, we address this challenge by applying classical machine learning algorithms together with several linguistic features, such as n-grams, readability, emotional tone and punctuation. In terms of pre-processing, we experiment with various steps like stop word removal, stemming/lemmatization, link removal and more. We find our best performing system to be based on a linear SVM, which obtains a weighted average F1 score of 95.19% on test data, which lands a place in the middle of the leaderboard (place 80 of 167).

연구 동기 및 목표

  • 코로나19 패an드emic 기간 동안 소셜미디어에서의 오락성 정보 분류 과제를 해결하기 위해.
  • 다양한 언어적 특징을 사용하여 고전적 기계학습 모델이 가짜 뉴스 탐지에 얼마나 효과적인지 평가하기 위해.
  • 분류 성능 향상을 위한 사전처리 파이프라인과 특징 조합을 최적화하기 위해.
  • 영어 가짜 뉴스 탐지 공유 작업인 Constraint 2021에 참가하고 기여하기 위해.
  • 수동으로 애너테이션된 데이터셋을 사용하여 기준 F1 스코어 93.46%와의 성능 비교를 위해.

제안 방법

  • 시스템은 선형 서포트 벡터 머신, 로지스틱 회귀, 랜덤 포레스트, 나이브 베이즈, 다층 퍼셉트론과 같은 고전적 기계학습 모델을 사용한다.
  • 텍스트 사전처리에는 소문자 변환, 링크 제거, 불용어 제거, 응답 제거, XML 엔티티 대체, NLTK의 TweetTokenizer를 사용한 어간 추출이 포함된다.
  • 사전처리된 텍스트에서 언어적 특징을 추출하며, 이는 일반형 및 이형형(일반형, 이형형) 특징(이하 n-그램), 프레시치 리딩 이지(독해력), 구두점 수(AllPunc, QMark, Exclam), 그리고 LIWC를 통한 감정 톤(Tone, affect, social, Authentic)를 포함한다.
  • 각 모델에 대해 최적의 설정을 도출하기 위해 초모수 및 특징 조합에 대한 그리드 서치를 수행한다.
  • 검증 세트 성능에 기반하여 가장 우수한 성능을 보인 모델을 선택하고, 최종 테스트 세트 예측에 사용한다.
  • 다섯 번의 시스템 런을 제출하였으며, 각 모델별로 하나씩 제출되었으며, 선형 서포트 벡터 머신이 가장 높은 테스트 F1 스코어를 기록했다.

실험 결과

연구 질문

  • RQ1소셜미디어 게시물에서 코로나19 가짜 뉴스를 분류하기 위해 어떤 고전적 기계학습 모델이 가장 우수한 성능을 보이는가?
  • RQ2n-그램, 독해력, 감정 톤, 구두점 등의 다양한 언어적 특징 조합이 분류 성능에 어떤 영향을 미치는가?
  • RQ3가짜 뉴스 탐지 정확도 향상을 위한 최적의 사전처리 파이프라인은 무엇인가?
  • RQ4특징 공학 및 모델 선택은 기준 F1 스코어 93.46%를 초월하여 성능을 얼마나 향상시키는가?
  • RQ5단일 특징을 별도로 사용하는 것과 다수의 언어적 특징 유형을 병합하여 사용할 경우의 성능 비교는 어떻게 되는가?

주요 결과

  • 선형 서포트 벡터 머신 모델은 검증 세트에서 가장 높은 가중 평균 F1 스코어 95.70%를 기록하여 기준치인 93.46%를 초월했다.
  • 최고의 성능을 보인 시스템은 선형 서포트 벡터 머신을 사용하며, 전체 특징 및 사전처리 파이프라인을 적용하여 테스트 세트에서 95.19%의 F1 스코어를 기록했으며, 총 167명의 참가자 중 80위를 기록했다.
  • 포괄적인 사전처리를 적용한 n-그램 특징만으로도 94.89%의 F1 스코어를 기록하여 추가 특징 없이도 뛰어난 성능을 보였다.
  • 독해력, 구두점, 감정 톤 특징을 개별적으로 조합하면 성능이 열악해졌으며(각각 57.58%, 49.17%, 59.22% F1), 이들의 조합은 67.21%로 향상되었다.
  • 검증 세트에서 기준 F1 스코어 93.46%를 초월한 모델은 선형 서포트 벡터 머신과 로지스틱 회귀 모델 둘 뿐이었다.
  • 최고의 SVM 모델의 혼동 행렬은 균형 잡힌 정밀도와 재현율을 보여주어 검증 데이터에 대한 강력한 일반화 능력을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.