Skip to main content
QUICK REVIEW

[論文レビュー] Two-Stage Classifier for COVID-19 Misinformation Detection Using BERT: a Study on Indonesian Tweets

Douglas Raevan Faisal, Rahmad Mahendra|arXiv (Cornell University)|Jun 30, 2022
Misinformation and Its Impacts被引用数 7
ひとこと要約

本研究では、インドネシア語のツイートにおける新型コロナウイルス関連の誤情報検出のため、2段階の分類器をインドネシア語BERT(IndoBERT)を用いて提案する。まず関連性をフィルタリングし、その後で誤情報として分類する。87.02%の正確性を達成し、ベースラインを上回り、高い品質の公開可能なインドネシア語誤情報データセットをリリースした。

ABSTRACT

The COVID-19 pandemic has caused globally significant impacts since the beginning of 2020. This brought a lot of confusion to society, especially due to the spread of misinformation through social media. Although there were already several studies related to the detection of misinformation in social media data, most studies focused on the English dataset. Research on COVID-19 misinformation detection in Indonesia is still scarce. Therefore, through this research, we collect and annotate datasets for Indonesian and build prediction models for detecting COVID-19 misinformation by considering the tweet's relevance. The dataset construction is carried out by a team of annotators who labeled the relevance and misinformation of the tweet data. In this study, we propose the two-stage classifier model using IndoBERT pre-trained language model for the Tweet misinformation detection task. We also experiment with several other baseline models for text classification. The experimental results show that the combination of the BERT sequence classifier for relevance prediction and Bi-LSTM for misinformation detection outperformed other machine learning models with an accuracy of 87.02%. Overall, the BERT utilization contributes to the higher performance of most prediction models. We release a high-quality COVID-19 misinformation Tweet corpus in the Indonesian language, indicated by the high inter-annotator agreement.

研究の動機と目的

  • インドネシアのソーシャルメディア、特にTwitterにおける新型コロナウイルス関連誤情報検出に関する研究の不足に対処する。
  • 関連性と誤情報の両方に焦点を当てた、インドネシア語のツイートからなる高品質な手動アノテーションデータセットを構築する。
  • BERTによる関連性フィルタリングと誤情報検出のためのBi-LSTMを組み合わせた2段階分類モデルを開発・評価する。
  • 低リソース言語環境において、インドネシア語BERTのような事前学習言語モデルが誤情報検出にどのように効果を発揮するかを示す。
  • 今後の研究を支援するため、データセットとモデルコードを公開する。

提案手法

  • 公開APIを用いて、1年を超えるインドネシア語の新型コロナウイルス関連ツイートデータを収集し、言語およびトピックの関連性でフィルタリングした。
  • 2段階のアノテーションプロセスを採用:まずトピックおよび言語基準に基づき「関連あり」または「トピック外」としてラベル付けし、その後で事実性の真偽を評価した。
  • ツイートの関連性を予測するためのシーケンス分類としてIndoBERTをベースモデルとして使用し、その後に誤情報分類の最終段階でBi-LSTMモデルを適用した。
  • 一貫性を確保するため、言語、トピックの関連性、検証可能な事実的主張の基準を含む、構造化されたアノテーションガイドラインを適用した。
  • 複数のベースラインモデル(例:SVM、ロジスティック回帰、Bi-LSTM)を評価し、提案された2段階のBERT-Bi-LSTMアンサンブルモデルと比較した。
  • データセットの品質を検証するため、アノテータ間一致度(Cohen’s kappa)を計算した。高い一致度スコアが得られた。

実験結果

リサーチクエスチョン

  • RQ1IndoBERTとBi-LSTMを用いた2段階分類器は、ベースラインモデルと比較して、インドネシア語の新型コロナウイルス関連ツイートにおける誤情報検出にどの程度効果的か?
  • RQ2低リソース言語環境において、IndoBERTのような事前学習言語モデルの使用は、誤情報検出性能をどの程度向上させるか?
  • RQ3手動アノテーションされたインドネシア語の新型コロナウイルス誤情報データセットの品質と信頼性は、アノテータ間一致度の観点からどの程度か?
  • RQ4関連性フィルタリングは、ノイズの多いソーシャルメディアデータにおける誤情報検出システム全体の性能をどの程度向上させるか?
  • RQ5パンデミック期のインドネシアのソーシャルメディア議論において、最も一般的に見られる誤情報の種類は何か?

主な発見

  • IndoBERTによる関連性検出とBi-LSTMによる誤情報分類を組み合わせた2段階分類器は、87.02%の最高正確性を達成した。
  • BERTベースのモデルは、すべての評価指標において、SVM やロジスティック回帰などの従来の機械学習モデルを常に上回った。
  • 提案されたデータセットは高いアノテータ間一致度を示し、Cohen’s kappaスコアからアノテータ間の信頼性が強く裏付けられた。
  • 関連性フィルタリングの導入により、モデルが関連性があり、事実に基づいた内容に集中する能力が著しく向上し、トピック外または事実でないツイートによるノイズが削減された。
  • インドネシア語のツイートにおける誤情報は、虚偽の医療的主張、誤解を招くワクチン情報、検証されていない陰謀論が一般的に含まれていた。
  • 公開されたデータセットとコードベースは、今後の多言語および低リソース誤情報検出分野の研究を支援すると期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。