Skip to main content
QUICK REVIEW

[論文レビュー] Fighting the COVID-19 Infodemic in Social Media: A Holistic Perspective and a Call to Arms

Firoj Alam, Fahim Dalvi|arXiv (Cornell University)|Jul 15, 2020
Misinformation and Its Impacts被引用数 15
ひとこと要約

本稿では、マルチリンガルなクラウドソーシングプラットフォームを活用して、事実性、有害性の潜在的リスク、公共の利益など7つの次元にわたるツイートのラベル付けを通じて、SNS上での新型コロナウイルス関連の誤情報の蔓延に対処する包括的で多角的なアノテーションフレームワークを提案する。トランスフォーマー・モデルを用いた実験により、特にマルチクラス設定においてベースラインを著しく上回る性能を示し、事実確認支援や公衆衛生対策を支援するための国際的コミュニティ参加によるツイートラベリングの必要性を提起する。

ABSTRACT

With the outbreak of the COVID-19 pandemic, people turned to social media to read and to share timely information including statistics, warnings, advice, and inspirational stories. Unfortunately, alongside all this useful information, there was also a new blending of medical and political misinformation and disinformation, which gave rise to the first global infodemic. While fighting this infodemic is typically thought of in terms of factuality, the problem is much broader as malicious content includes not only fake news, rumors, and conspiracy theories, but also promotion of fake cures, panic, racism, xenophobia, and mistrust in the authorities, among others. This is a complex problem that needs a holistic approach combining the perspectives of journalists, fact-checkers, policymakers, government entities, social media platforms, and society as a whole. Taking them into account we define an annotation schema and detailed annotation instructions, which reflect these perspectives. We performed initial annotations using this schema, and our initial experiments demonstrated sizable improvements over the baselines. Now, we issue a call to arms to the research community and beyond to join the fight by supporting our crowdsourcing annotation efforts.

研究の動機と目的

  • 新型コロナウイルスの誤情報拡散問題が、事実の誤りにとどまらず、パニック、人種差別、有害な治療法の提唱といった多面的な側面を有することを踏まえ、その複雑かつ多様な性質に対処すること。
  • ジャーナリスト、事実確認機関、政策立案者、SNSプラットフォーム、社会一般の視点を統合した包括的なアノテーションスキーマの開発。
  • MicroMappersを基盤とするボランティアベースのマルチリンガルクラウドソーシングプラットフォームの構築により、アノテーションの負担を軽減し、品質を向上させること。
  • 訓練および評価用の誤情報検出モデルのための、英語およびアラビア語で公開可能な高品質なデータセットの作成。
  • 真偽の判断にとどまらず、有害性や社会的意義のあるコンテンツも検出可能な、強固なNLPモデルの開発を支援すること。

提案手法

  • 著者らは、検証可能な主張、虚偽の可能性、公共の利益、有害性の潜在的リスク、事実確認の必要性、社会的有害性、政府の関心の7つの質問からなるアノテーションスキーマを定義した。
  • MicroMappersフレームワークを活用し、英語およびアラビア語のツイートに対して、ボランティアによるマルチリンガルなクラウドソーシングプラットフォームを実装した。
  • アノテーションの信頼性を確保し、ラベル付けにおける主観性に対処するため、1つの例に対して複数のアノテーターが関与するプロセスを採用した。
  • BERT、RoBERTa、mBERT、ALBERT、XLM-R、AraBERT、FastTextなどのさまざまなNLPモデルを、二値分類およびマルチクラス分類の両タスクで訓練および評価した。
  • モデルの訓練にあたり、デフォルト設定で3エポックにわたり微調整を行い、開発セットの性能に基づいて最良のモデルを選定した。
  • データセット内のクラス不均衡を考慮するため、評価指標として加重F1スコアを用いた。

実験結果

リサーチクエスチョン

  • RQ1多面的アノテーションスキーマは、単なる事実性を越えて、新型コロナウイルス誤情報拡散における多様な有害コンテンツの形態を効果的に捉えることができるか?
  • RQ2マルチリンガルでクラウドソーシングされたラベル付けは、誤情報検出データセットの品質とスケーラビリティにどのような影響を与えるか?
  • RQ3事前学習済み言語モデルは、新型コロナウイルス関連のツイートにおけるさまざまなタイプの有害または社会的に重要なコンテンツを、どの程度検出できるか?
  • RQ4本研究で提案するマルチラベルスキーマに基づいて訓練されたモデルは、二値分類およびマルチクラス分類の両設定において、ベースライン手法を上回る性能を示せるか?
  • RQ5アラビア語のような低リソース言語や語形変化が複雑な言語では、文字レベルの埋め込み(例:FastText)がトランスフォーマー基盤のモデルを上回る性能を示す程度はどの程度か?

主な発見

  • すべてのトランスフォーマー基盤モデルが、英語およびアラビア語のデータセットにおいて、多数クラスベースラインを上回った。これは、トランスファー学習が誤情報拡散検出に有効であることを裏付けた。
  • 二値分類においては、英語タスクの大部分でBERTとRoBERTaが最良の結果を示したが、アラビア語の7つのタスクのうち4つではmBERTが他を上回った。
  • マルチクラス分類においては、英語の6つのタスクのうち4つでmBERTが最高のF1スコアを記録し、複雑なラベル空間における優れた一般化性能を示した。
  • アラビア語においては、FastTextが複数のタスクですべてのトランスフォーマー基盤モデルを上回った。これは、言語の語形変化やスペルミスに対する強健性によるものと推定される。
  • マルチリンガルなmBERTモデルは、両言語で優れた性能を示し、多言語間誤情報検出への応用可能性を示唆した。
  • 本研究は、真偽の判断に加え、社会的・プラットフォーム関連の次元を統合することで、実世界の応用に向けた検出システムの実用性が著しく向上することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。