Skip to main content
QUICK REVIEW

[論文レビュー] Reputation Systems for News on Twitter: A Large-Scale Study

Luca de Alfaro, Massimo Di Pierro|arXiv (Cornell University)|Feb 22, 2018
Misinformation and Its Impacts参考文献 11被引用数 7
ひとこと要約

本論文では、主流メディアの報道機関において1%未満の非常に低い偽陽性率を達成しつつ、高精度でフェイクニュースや誤解を招くニュースを検出する、Twitter上のニュース向けのレピュテーションシステムを提案する。研究では、リツイート行動とコンテンツメタデータに基づいて訓練された単純なロジスティック回帰モデルが、非常に多くのウイルス的拡散を示すフェイクニュースの85%以上を同定できることを示している。また、信頼できる情報源に対しては高い信頼性を維持している。

ABSTRACT

Social networks offer a ready channel for fake and misleading news to spread and exert influence. This paper examines the performance of different reputation algorithms when applied to a large and statistically significant portion of the news that are spread via Twitter. Our main result is that simple algorithms based on the identity of the users spreading the news, as well as the words appearing in the titles and descriptions of the linked articles, are able to identify a large portion of fake or misleading news, while incurring only very low (<1%) false positive rates for mainstream websites. We believe that these algorithms can be used as the basis of practical, large-scale systems for indicating to consumers which news sites deserve careful scrutiny and skepticism.

研究の動機と目的

  • 大規模かつ現実世界のTwitterデータセットを用いて、レピュテーションアルゴリズムがフェイクニュースや誤解を招くニュースを検出する性能を評価すること。
  • これらのシステムが、初期の学習データに含まれない未知の低品質ニュースサイトに対しても一般化できるかを評価すること。
  • 信頼できる主流メディアの報道機関における偽陽性率を最小限に抑えること。これは、自動検出システムにおけるユーザーの信頼を維持するために不可欠である。
  • 人間の事実確認作業の前段階として、レピュテーションシステムをスケーラブルなツールとして活用する可能性を検討すること。

提案手法

  • 著者らは、主流メディアの報道機関、学術的査読済み論文、および既知の低品質サイトを含む、550万件のニュース記事、8800万件のツイート、900万人のユーザーから成るデータセットを収集した。
  • 3つのレピュテーションアルゴリズムを評価した:ユーザーIDと記事の見出し/要約の語を用いたロジスティック回帰モデル、共通のリツイート行動に基づいてユーザーをグループ化するトピックモデリングの変種、グラフ上の調和関数にインspiredされたグラフベースのコラボラティブスコアリング手法。
  • 基準となる真偽を、独立した2つの低品質ニュースサイトリスト(Opensources(2017年)、Metacert)を用いて確立した。それぞれのリストには約500のサイトが含まれていた。
  • 性能評価は、約140万件のニュースアイテムと2000万件のツイートを含む時間的スライスごとに行われ、フェイクニュースの再現率と主流メディアの報道機関における偽陽性率に焦点を当てた。
  • システムはTruth Value Projectの一部として実装されており、公開API、Twitterボット(hoaxbot)、ブラウザーブックマークレットを備えており、リアルタイムでのレピュテーションスコアリングを可能としている。
  • ハーモニックコラボラティブスコアリング手法により、新規データの到着に伴う段階的学習が可能であり、動的アップデートが可能である。

実験結果

リサーチクエスチョン

  • RQ1Twitterで共有されるニュースの全範囲に応用されたレピュテーションシステムは、フェイクニュースや誤解を招くニュースをどの程度効果的に検出できるか?
  • RQ2これらのシステムは主流メディアの報道機関においてどの程度の偽陽性率を示し、それが許容可能な低水準を維持しているか?
  • RQ3既知の低品質サイトから学習したレピュテーションシステムは、他の懸念を要する、または未だ未知のサイトを同定できるか?
  • RQ4ユーザーベース、コンテンツベース、グラフベースの異なるアルゴリズム的手法は、性能とスケーラビリティの観点でどのように比較できるか?

主な発見

  • ユーザーIDと記事のテキスト特徴量の両方を用いたロジスティック回帰モデルは、10件以上のツイートを受けたフェイクニュースに対して85%以上の再現率を達成した一方で、主流メディアの報道機関では偽陽性率が1%未満に抑えられていた。
  • ユーザーIDにのみ依存するアルゴリズムは、ユーザーとコンテンツの両方の特徴を使用するモデルとほぼ同等の性能を示したが、一時的な共有URLではコンテンツ特徴量が顕著な向上効果をもたらした。
  • ハーモニックコラボラティブスコアリング手法は、非常に優れた一般化性能を示し、2つの独立した真偽リストのいずれかで学習させた場合でも分類結果の差が最小限に抑えられ、異なる学習データに対しても堅牢であることが示された。
  • 偽陽性分析の過程で、システムは人間の事実確認者にとって事前に未知の低品質ニュースサイトを多数同定した。これは、人間の事実確認作業の前段階としての有効性を示唆している。
  • サイト検出性能は強く、他の真偽リスト(データセットに20件以上のURLを含む)からのサイトの80%以上が、完全な学習セットを用いた場合にフェイクまたは誤解を招くものとして正しく特定された。
  • ハーモニック手法は効果的ではあるが、グラフ全体の接続構造に依存するため、調整に多大な作業を要し、小規模な実験が困難であることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。