[論文レビュー] MuMiN: A Large-Scale Multilingual Multimodal Fact-Checked Misinformation Social Network Dataset
MuMiNは、41の言語で13,000件の事実確認済み主張に意味的にリンクされた2,100万件のツイートを含む大規模で多言語・多モodalな事実確認済み誤情報データセットを提供する。このデータセットは異種グラフとして構造化され、Pythonパッケージ(mumin)、ベースラインモデル、リーダーボードとともに公開されており、真偽予測タスクで最高で62.55%のマクロF1スコアを達成した。
Misinformation is becoming increasingly prevalent on social media and in news articles. It has become so widespread that we require algorithmic assistance utilising machine learning to detect such content. Training these machine learning models require datasets of sufficient scale, diversity and quality. However, datasets in the field of automatic misinformation detection are predominantly monolingual, include a limited amount of modalities and are not of sufficient scale and quality. Addressing this, we develop a data collection and linking system (MuMiN-trawl), to build a public misinformation graph dataset (MuMiN), containing rich social media data (tweets, replies, users, images, articles, hashtags) spanning 21 million tweets belonging to 26 thousand Twitter threads, each of which have been semantically linked to 13 thousand fact-checked claims across dozens of topics, events and domains, in 41 different languages, spanning more than a decade. The dataset is made available as a heterogeneous graph via a Python package (mumin). We provide baseline results for two node classification tasks related to the veracity of a claim involving social media, and demonstrate that these are challenging tasks, with the highest macro-average F1-score being 62.55% and 61.45% for the two tasks, respectively. The MuMiN ecosystem is available at https://mumin-dataset.github.io/, including the data, documentation, tutorials and leaderboards.
研究の動機と目的
- 機械学習研究における誤情報検出のための、大規模で多言語・多モーダルなデータセットの不足に対処する。
- 主に単一言語・単一モーダルで、範囲やスケールに制限のある既存のデータセットの限界を克服する。
- 多様なトピック、分野、言語的変異を捉えることで、一般化可能でイベントに依存しない誤情報検出モデルの訓練を可能にする。
- 研究者が多モーダルおよびグラフベースの誤情報検出システムをベンチマークできる再現可能で倫理的かつアクセス可能なデータエコシステムを提供する。
- テキスト、視覚的、ソーシャルネットワークのモーダルを統合するモデルの開発を支援し、真偽予測の向上を図る。
提案手法
- 自動的に公開されたTwitterデータを収集し、事実確認済み主張に意味的にリンクするためのデータ収集・リンクシステム「MuMiN-trawl」を開発した。
- 26,000件のTwitterスレッドにまたがる2,100万件のツイートを収集し、多様なトピックと分野から抽出された13,000件の事実確認済み主張にリンクした。
- テキスト(ツイート、記事)、画像、ユーザーメタデータ、ハッシュタグ、ソーシャルネットワークの相互作用(リツイート、返信、引用)の複数のモーダルを統合した。
- 未構造化された事実確認の結論を3つのカテゴリに分類するため、微調整されたトランスフォーマーモデルを用いた。: 実際の事実、誤情報、その他。
- データセットを異種グラフとして構造化し、グラフ機械学習フレームワークへの統合を可能にするmumin Pythonパッケージを通じて公開した。
- 主張の真偽と事実確認の可能性の2つのノード分類タスクに対して、テキストのみ、画像のみ、および異種グラフニューラルネットワークのベースラインモデルを実装した。
実験結果
リサーチクエスチョン
- RQ1大規模で多言語・多モーダルなデータセットは、単一言語や単一モーダルアプローチに比べて、誤情報検出モデルの一般化を向上させることができるか?
- RQ2リツイートや返信などのソーシャルネットワーク構造は、テキストや画像特徴のみに比べて、主張の真偽予測をどの程度向上させることができるか?
- RQ3異種グラフニューラルネットワークは、多様なトピックや出来事において、多言語・多モーダルな誤情報パターンをどの程度効果的に捉えることができるか?
- RQ4現実的で大規模かつ多様な誤情報検出ベンチマークにおいて、現在のモデルの性能の上限はどの程度か?
- RQ5非英語の誤情報主張に対して微調整する際、多言語モデルは翻訳ベースのアプローチと比べてどの程度優れているか?
主な発見
- MuMiNデータセットには、41の言語と数十のトピックをカバーする13,000件の事実確認済み主張にリンクされた2,100万件のツイートが含まれている。
- データセットは10年以上にわたるソーシャルメディア活動をカバーしており、モデルのトレーニングと評価に向けた時間的多様性と長期的関連性を確保している。
- 主張の真偽予測タスクで達成された最高のマクロ平均F1スコアは62.55%であり、タスクの本質的な難易度を示している。
- 事実確認の可能性予測タスクにおける最高のマクロF1スコアは61.45%であり、これは優れたモデルですら、この複雑な多モーダル分類タスクに苦戦していることを示している。
- 微調整されたトランスフォーマーモデルはテストセットで高いパフォーマンスを達成したが、未構造化された結論の複雑さのため、一部の誤分類は避けがたい。
- mumin Pythonパッケージは、標準的なグラフ機械学習ライブラリへのデータコンパイルとエクスポートを効率的に行い、既存の研究プロトコルへの統合を容易にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。