Skip to main content
QUICK REVIEW

[論文レビュー] An Exploration of Unreliable News Classification in Brazil and The U.S

Maurício Gruppi, Benjamin D. Horne|arXiv (Cornell University)|Jun 7, 2018
Misinformation and Its Impacts参考文献 6被引用数 3
ひとこと要約

本研究は、ブラジルおよび米国における誤情報の分類を、文章スタイルおよび言語的複雑さの特徴を用いて調査する。その結果、特に簡潔さ、文の長さ、標点記号に関連する少数の普遍的特徴が、ポルトガル語および英語のデータセットの両方で信頼できる情報源と信頼できない情報源を70%の正確さで区別できることを示しており、誤情報検出におけるスタイル的指標の言語的および文化的な一般化可能性を示している。

ABSTRACT

The propagation of unreliable information is on the rise in many places around the world. This expansion is facilitated by the rapid spread of information and anonymity granted by the Internet. The spread of unreliable information is a wellstudied issue and it is associated with negative social impacts. In a previous work, we have identified significant differences in the structure of news articles from reliable and unreliable sources in the US media. Our goal in this work was to explore such differences in the Brazilian media. We found significant features in two data sets: one with Brazilian news in Portuguese and another one with US news in English. Our results show that features related to the writing style were prominent in both data sets and, despite the language difference, some features have a universal behavior, being significant to both US and Brazilian news articles. Finally, we combined both data sets and used the universal features to build a machine learning classifier to predict the source type of a news article as reliable or unreliable.

研究の動機と目的

  • ブラジル(ポルトガル語)および米国(英語)のメディアにおいて、文章スタイルの特徴が信頼できる、信頼できない、風刺的なニュースソースを区別できるかどうかを調査すること。
  • 信頼できないニュースを特定する特徴が、異なる言語、文化、政治的文脈において普遍的である程度を評価すること。
  • 両データセットから得られた共通の特徴を用いて、統一された機械学習分類器を構築し、国や言語を超えたソース信頼性を予測すること。
  • 英語および単一国に限定されない文脈において、コンテンツベースの特徴の一般化可能性を評価すること。

提案手法

  • ブラジルのニュース(ポルトガル語)および米国のニュース(英語)の両方のデータセットを収集・分析し、信頼できる、信頼できない、風刺的なソースに焦点を当てた。
  • テキストの複雑さ(例:語長、文の長さ)、スタイル的特徴(例:句読点、大文字の使用)、品詞のパターンの3つのカテゴリに分け、合計188の言語的およびスタイル的特徴を抽出した。
  • 信頼できる、信頼できない、風刺的なソースの間で有意に差があるとされる特徴を、それぞれのデータセットで統計的有意性検定を用いて同定した。
  • U.S.およびブラジルのデータセット間での特徴順序の一致度を測るためにケンダールのtau相関を適用し、一貫した傾向を示す特徴を同定した。
  • 両データセットで有意であった特徴の共通部分を用いて機械学習分類器を訓練し、統合データセットにおけるソースタイプの予測を実施した。
  • モデルのパフォーマンスをテスト精度で評価し、ランダム推測の基準は50%とした。

実験結果

リサーチクエスチョン

  • RQ1米国およびブラジルのメディアにおいて、文章スタイルの特徴のみで信頼できる、信頼できない、風刺的なニュースソースを区別できるか?
  • RQ2両国に共通する有意な言語的特徴が存在し、一貫した傾向を示すものかどうか、すなわち普遍性があるかどうか?
  • RQ31つの言語および文化で訓練された一組の特徴が、別の言語および文化においてもニュース信頼性の分類にどの程度一般化可能か?
  • RQ4スタイル的特徴と複雑さの特徴は、言語および文化を超えて、ソースタイプを区別する能力において、どのように比較されるか?

主な発見

  • ブラジルのデータセットでは、60個の有意特徴を用いて信頼できるニュースと信頼できないニュースを分類するテスト精度が85%に達し、50%のベースラインを著しく上回った。
  • 米国のデータセットでは、49個の有意特徴を用いてテスト精度が72%に達し、再びベースラインを上回った。これにより、言語的特徴の予測力が裏付けられた。
  • 両データセットに共通する18の特徴のみを用いた統合分類器は70%の正確度を達成し、言語および文化を超えた普遍的特徴の存在を示した。
  • テキストの複雑さに関連する特徴(例:全体的な長さが短い、文が長い、言語が単純)は、両国において信頼できないソースで一貫して顕著であった。
  • 疑問符、感嘆符、すべて大文字の使用増加といったスタイル的特徴は、信頼できないソースで顕著に多く見られ、注目を引く戦略を示唆している。
  • 品詞の特徴は両国間で一貫性が弱く、構文的パターンよりも、複雑さとスタイル的特徴が分類に普遍的に信頼できると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。