Skip to main content
QUICK REVIEW

[논문 리뷰] Two-Stage Classifier for COVID-19 Misinformation Detection Using BERT: a Study on Indonesian Tweets

Douglas Raevan Faisal, Rahmad Mahendra|arXiv (Cornell University)|2022. 06. 30.
Misinformation and Its Impacts인용 수 7
한 줄 요약

이 연구는 인도네시아어 트윗에서 코로나19 위기 가짜정보를 탐지하기 위해 IndoBERT를 사용한 이단계 분류기 모델을 제안한다. 먼저 관련성 여부를 필터링하고, 그 다음 가짜정보 여부를 분류한다. 이 모델은 87.02%의 정확도를 기록하며 기준 모델들을 능가하며, 높은 품질의 공개 가능한 인도네시아어 가짜정보 데이터셋도 함께 제공한다. 이 데이터셋은 높은 상호 평가 일치도를 보였다.

ABSTRACT

The COVID-19 pandemic has caused globally significant impacts since the beginning of 2020. This brought a lot of confusion to society, especially due to the spread of misinformation through social media. Although there were already several studies related to the detection of misinformation in social media data, most studies focused on the English dataset. Research on COVID-19 misinformation detection in Indonesia is still scarce. Therefore, through this research, we collect and annotate datasets for Indonesian and build prediction models for detecting COVID-19 misinformation by considering the tweet's relevance. The dataset construction is carried out by a team of annotators who labeled the relevance and misinformation of the tweet data. In this study, we propose the two-stage classifier model using IndoBERT pre-trained language model for the Tweet misinformation detection task. We also experiment with several other baseline models for text classification. The experimental results show that the combination of the BERT sequence classifier for relevance prediction and Bi-LSTM for misinformation detection outperformed other machine learning models with an accuracy of 87.02%. Overall, the BERT utilization contributes to the higher performance of most prediction models. We release a high-quality COVID-19 misinformation Tweet corpus in the Indonesian language, indicated by the high inter-annotator agreement.

연구 동기 및 목표

  • 특히 트위터에서의 인도네시아어 소셜 미디어에서의 코로나19 가짜정보 탐지에 관한 연구의 부족을 해결하기 위해.
  • 코로나19 관련 인도네시아어 트윗에 대해 관련성과 가짜정보 여부에 중점을 두어 고품질의 수작업으로 주석 처리된 데이터셋을 구축하기 위해.
  • BERT를 사용한 관련성 필터링과 Bi-LSTM를 사용한 가짜정보 탐지의 조합을 통한 이단계 분류 모델을 개발하고 평가하기 위해.
  • 저자원 언어 환경에서 인도네시아어와 같은 언어에 대해 사전 학습된 언어 모델(예: IndoBERT)이 가짜정보 탐지에 얼마나 효과적인지 입증하기 위해.
  • 향후 다국어 가짜정보 탐지 연구를 지원하기 위해 데이터셋과 모델 코드를 공개하기 위해.

제안 방법

  • 공개 API를 사용하여 코로나19 관련 1년 이상의 인도네시아어 트윗 데이터를 수집하고 언어 및 주제 관련성 기준으로 필터링하였다.
  • 이단계 주석 처리 과정을 적용: 먼저 주제 및 언어 기준에 따라 트윗을 '관련 있음' 또는 '주제 외'로 레이블링한 후, 사실성 여부를 평가하였다.
  • 시퀀스 분류를 위해 IndoBERT를 기본 모델로 사용하여 트윗의 관련성 여부를 예측한 후, 최종 가짜정보 분류를 위해 Bi-LSTM 모델을 사용하였다.
  • 일致성을 확보하기 위해 언어, 주제 관련성, 검증 가능한 사실적 진술 기준을 포함한 체계적인 주석 지침을 적용하였다.
  • 다양한 기준 모델(예: SVM, 로지스틱 회귀, Bi-LSTM)을 평가하고 제안된 이단계 BERT-Bi-LSTM 앙상블 모델과 비교하였다.
  • 데이터셋 품질을 검증하기 위해 상호 평가 일치도(Cohen’s kappa)를 계산하였다. 높은 일치도 점수를 기록하였다.

실험 결과

연구 질문

  • RQ1IndoBERT와 Bi-LSTM를 사용한 이단계 분류기가 기준 모델들과 비교해 인도네시아어 코로나19 트윗의 가짜정보 탐지에 얼마나 효과적인가?
  • RQ2IndoBERT와 같은 사전 학습된 언어 모델의 사용이 저자원 언어 환경에서의 가짜정보 탐지 성능에 얼마나 기여하는가?
  • RQ3수작업 주석 처리된 인도네시아어 코로나19 가짜정보 데이터셋의 품질과 신뢰성은 상호 평가 일치도 측면에서 어떻게 평가되는가?
  • RQ4관련성 필터링이 노이즈가 많은 소셜 미디어 데이터에서 가짜정보 탐지 시스템의 전체 성능에 어떻게 기여하는가?
  • RQ5팬데믹 기간 동안 인도네시아 소셜 미디어 논의에서 가장 흔한 유형의 가짜정보는 무엇인가?

주요 결과

  • IndoBERT를 사용한 관련성 탐지와 Bi-LSTM를 사용한 가짜정보 분류를 조합한 이단계 분류기가 87.02%의 최고 정확도를 기록하였다.
  • BERT 기반 모델은 모든 평가 지표에서 기존의 기계학습 모델(SVM, 로지스틱 회귀)을 일관되게 능가하였다.
  • 제안된 데이터셋은 높은 상호 평가 일치도를 보였으며, Cohen’s kappa 점수를 통해 주석자 간 강력한 신뢰성 확보를 확인하였다.
  • 관련성 필터링의 통합은 모델이 관련성 있고 사실 기반의 콘텐츠에 집중할 수 있도록 도와주어, 주제 외 또는 사실이 아닌 트윗으로 인한 노이즈를 줄였다.
  • 인도네시아어 트윗에서 흔히 발견되는 가짜정보는 잘못된 의료 진술, 오해의 소재가 되는 백신 정보, 검증되지 않은 음모 이론이 포함되어 있었다.
  • 공개된 데이터셋과 코드베이스는 향후 다국어 및 저자원 가짜정보 탐지 연구를 지원할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.