[論文レビュー] VoterFraud2020: a Multi-modal Dataset of Election Fraud Claims on Twitter
本論文は、2020年10月23日〜12月16日におけるTwitter上での米国選挙不正説に関する投稿を対象に、760万件のツイートおよび2,560万件のリツイートを含む大規模なマルチモーダルデータセット「VoterFraud2020」を紹介する。本データセットは、リツイートに基づくユーザークラスターやアカウント停止状況、16万8千枚の画像の知覚ハッシュ、外部リンク13万8千件およびYouTube動画1万2千本の集約メタデータを追加することで、フェイクニュースネットワークやプラットフォームの対応を分析可能にする。
The wide spread of unfounded election fraud claims surrounding the U.S. 2020 election had resulted in undermining of trust in the election, culminating in violence inside the U.S. capitol. Under these circumstances, it is critical to understand the discussions surrounding these claims on Twitter, a major platform where the claims were disseminated. To this end, we collected and released the VoterFraud2020 dataset, a multi-modal dataset with 7.6M tweets and 25.6M retweets from 2.6M users related to voter fraud claims. To make this data immediately useful for a diverse set of research projects, we further enhance the data with cluster labels computed from the retweet graph, each user's suspension status, and the perceptual hashes of tweeted images. The dataset also includes aggregate data for all external links and YouTube videos that appear in the tweets. Preliminary analyses of the data show that Twitter's user suspension actions mostly affected a specific community of voter fraud claim promoters, and exposes the most common URLs, images and YouTube videos shared in the data.
研究の動機と目的
- 1月6日ワashington・コンプライアンス事件につながった根拠のない選挙不正説の拡散に関する実証的データの不足を解消すること。
- API制限がある中でも、2020年米国選挙不正説に関する包括的でマルチモーダルなTwitter議論データセットを収集・公開すること。
- 研究利用の拡張を図るため、ユーザークラスタ、アカウント停止状況、画像の知覚ハッシュ、リンクメタデータといった実用的ラベルを生データに追加すること。
- フェイクニュースネットワークの構造、プラットフォームの規制影響、視覚的および動画コンテンツが主張をどのように拡散に寄与したかを研究者に分析可能にする。
- 高リスクの民主的出来事における選挙の整合性、フェイクニュース、コンテンツモデレーション政策の有効性に関する学術的研究を支援すること。
提案手法
- 2020年10月23日〜12月16日(55日間)の期間、Twitter Streaming APIを用いて、キーワード(例:"voter fraud", "#stopthesteal")を手動で選別したデータ駆動型キーワードセットに基づきツイートを収集した。
- APIレート制限およびサンプリング検証に基づき、ターゲットキーワードを含む全ツイートの約60%のカバレッジを推定した。
- リツイートグラフに基づくクラスタリングアルゴリズムを用いて、一貫性のある議論ネットワークを特定するユーザーコミュニティラベルを計算した。
- 2021年1月10日時点のユーザーアカウント停止状況を取得し、プラットフォームのモデレーション効果を分析可能にした。
- 16万8千枚の画像に対して知覚ハッシュを生成し、視覚的類似性分析および画像追跡を可能にした。
- 外部リンク13万8千件およびユニークなYouTube動画1万2千本のメタデータ(動画ID、URL、エンゲージメント指標など)を集約した。
実験結果
リサーチクエスチョン
- RQ1選挙不正説を広めた主なユーザーコミュニティはどれで、Twitterのアカウント停止措置はそれらにどのように影響したか?
- RQ2選挙不正説に関連して最も広く共有された視覚的および動画コンテンツの種別は何か? それらのリーチと類似性はどのように比較されるか?
- RQ3不正説を広めるユーザーよりも外部リンクが示す情報源の信頼性とリーチは、特にYouTubeや低品質ニュースサイトへのリンクにおいて、どのように異なるか?
- RQ4プラットフォームのモデレーション、たとえばユーザーアカウントの停止措置が、選挙不正説を広める特定のユーザークラスタをどれほど的確に標的としたか?
- RQ5不正説に関連する最もリツイートされた画像と動画は、視覚的コンテンツおよび配布パターンにおいてどのように異なるか?
主な発見
- QAnonと関連する主なユーザーグループは、選挙不正説を広めたが、Twitterのアカウント停止措置の標的とされやすく、このコミュニティの約7.8%が停止処分を受けた。
- リツイート数が最も多い画像は、最もリツイートされた画像とは視覚的に明確に異なり、ウイルス的拡散における異なる視覚戦略が存在することを示している。
- 選挙不正説を広めた上位10のYouTubeチャンネルは、規模は小さかったが、非常に高いリーチを達成しており、2021年1月11日時点で全10チャンネルが依然として活動を継続していた。
- 主に不正説を広めるユーザーよりも外部リンクは、低品質ニュースサイト、ストリーミングサービス、YouTubeを指向しており、主流メディアの存在は限定的であった。
- アカウント停止状況や知覚ハッシュといったデータセットの強化ラベルのおかげで、フェイクニュースを駆動するコアネットワークを研究者が特定・分析可能となった。
- Twitterが停止ユーザーのツイートを削除したにもかかわらず、公開データセットはツイートIDと画像ハッシュを保持しており、研究のための倫理的かつアクセス可能な重要なコンテンツを維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。