Skip to main content
QUICK REVIEW

[論文レビュー] Limiting the Spread of Fake News on Social Media Platforms by Evaluating Users' Trustworthiness

Oana Balmau, Rachid Guerraoui|arXiv (Cornell University)|Aug 29, 2018
Misinformation and Its Impacts参考文献 41被引用数 5
ひとこと要約

Credulix は、事実チェック済みのニュースアイテムに対するユーザーの過去の共有行動に基づいてニュースの信頼性を推定することで、ソーシャルメディア上でのフェイクニュースの拡散を制限するコンテンツに依存しないシステムである。ユーザーの信頼性記録に基づくベイジアンフレームワークを用い、99%以上のフェイクニュースを偽陽性を伴わず特定し、ユーザー操作における遅延オーバーヘッドは3%未満、スループットへの影響は8%未満に抑えられる。

ABSTRACT

Today's social media platforms enable to spread both authentic and fake news very quickly. Some approaches have been proposed to automatically detect such "fake" news based on their content, but it is difficult to agree on universal criteria of authenticity (which can be bypassed by adversaries once known). Besides, it is obviously impossible to have each news item checked by a human. In this paper, we a mechanism to limit the spread of fake news which is not based on content. It can be implemented as a plugin on a social media platform. The principle is as follows: a team of fact-checkers reviews a small number of news items (the most popular ones), which enables to have an estimation of each user's inclination to share fake news items. Then, using a Bayesian approach, we estimate the trustworthiness of future news items, and treat accordingly those of them that pass a certain "untrustworthiness" threshold. We then evaluate the effectiveness and overhead of this technique on a large Twitter graph. We show that having a few thousands users exposed to one given news item enables to reach a very precise estimation of its reliability. We thus identify more than 99% of fake news items with no false positives. The performance impact is very small: the induced overhead on the 90th percentile latency is less than 3%, and less than 8% on the throughput of user operations.

研究の動機と目的

  • コンテンツベースの検出が信頼性に欠け、大規模な人為的事実チェックが現実的でないソーシャルメディアプラットフォームにおける、ウイルス性フェイクニュースの防止という課題に対処すること。
  • コンテンツ分析やユーザーのラベル付けを必要とせず、既存の事実チェック作業を活用するスケーラブルで導入可能なシステムの開発。
  • ソーシャルメディアプラットフォームにおけるパフォーマンスオーバーヘッドを最小限に抑えつつ、フェイクニュースの検出精度を高い水準で維持すること。
  • 検証済み事実チェックに基づく行動的信頼性指標を用いて、ソーシャルネットワークがウイルス性に達する前に対処するフェイクニュースの事前抑制を可能にすること。
  • 特定の言語的・意味的特徴に依存せず、既存のコンテンツベースの検出手法と補完的に機能する汎用的でプラグイン型のソリューションを提供すること。

提案手法

  • 事実チェック済みニュースアイテムの閲覧・共有履歴を追跡することで、ユーザー信頼性記録(UCRs)を収集し、ユーザーの信頼性のベースラインを確立する。
  • ラプラスの成功の法則を適用し、ユーザーの過去の行動に基づいてフェイクニュースを共有する確率の事前確率を推定する。
  • ベイズの定理を用いて、特定のニュースアイテムがフェイクであるという事後確率を、そのアイテムを共有したユーザーの集合に基づき計算する。
  • 信頼性のしきい値(例:99.9999%)を定義し、信頼性が低いと判断されたアイテムを不適切とマークして、さらなる拡散を防ぐ。
  • ソーシャルメディアプラットフォームにプラグインとして統合し、コンテンツ分析とは独立して動作させ、ユーザーのフィードバックやタグ付けを一切不要とする。
  • コンドルセの陪審員定理の精神を踏襲し、多数のユーザーからの弱い信号を集約することで、フェイクニュース検出における高い集団的信頼性を達成する。

実験結果

リサーチクエスチョン

  • RQ1コンテンツに依存しないシステムが、事実チェック済みのニュースアイテムに対するユーザーの共有行動のみを用いて、フェイクニュースの拡散を効果的に検出・制限できるか。
  • RQ2ベイジアンモデルが、共有したユーザーの信頼性に基づいて、ニュースアイテムがフェイクである確率をどれほど正確に推定できるか。
  • RQ3このようなシステムを、Twitterのような大規模なソーシャルネットワークに展開した際のパフォーマンスオーバーヘッドはどの程度か。
  • RQ4少数の事実チェック済みウイルス性ニュースアイテムがあれば、多数の新しいニュースアイテムの信頼性をどれほど正確に推定できるか。
  • RQ5実世界の展開において、偽陽性ゼロでフェイクニュースのほぼ完全な検出が可能か。

主な発見

  • Credulix は、4100万ユーザーの実世界の Twitter グラフに適用した結果、99%を超えるフェイクニュースを偽陽性ゼロで特定した。
  • たとえ数1000人のユーザーが特定のニュースアイテムに暴露された場合でも、その信頼性を正確に推定できるほどの高い検出精度を達成した。
  • パフォーマンスオーバーヘッドは最小限で、90パーセンタイルの遅延は3%未満、負荷下でのスループット低下も8%未満であった。
  • ベイジアンモデルはコンテンツ分析や言語的特徴に依存せず、ユーザー行動の集約によりニュースアイテムの信頼性を効果的に推定できた。
  • このアプローチは、すべてのコンテンツをチェックするのではなく、最もウイルス性の高いニュースアイテムのみを事実チェック担当者がレビューすればよいという点で、強固でスケーラブルである。
  • Credulix は既存のコンテンツベースの検出システムと補完的に機能し、コアのソーシャルメディアインfra構造を変更することなく、プラグインとして導入可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。