Skip to main content
QUICK REVIEW

[論文レビュー] Fake News Detection Using Majority Voting Technique

D. R. Patil|arXiv (Cornell University)|Mar 18, 2022
Misinformation and Its Impacts被引用数 5
ひとこと要約

本論文は、公開データセットから得た10,387件の本物のニュース記事および10,413件の偽りのニュース記事を用いて、不正なニュース検出のための多数決アンサンブルモデルを提案する。決定木、ロジスティック回帰、XGBoost、ランダムフォレスト、エキストラツリー、AdaBoost、SVM、SGD、およびナイーブベイズの複数の分類器からの予測を統合することで、96.38%の正確性、96%の適合率、96%の再現率、および96%のF1スコアを達成し、個々のモデルを上回る性能を発揮した。

ABSTRACT

Due to the evolution of the Web and social network platforms it becomes very easy to disseminate the information. Peoples are creating and sharing more information than ever before, which may be misleading, misinformation or fake information. Fake news detection is a crucial and challenging task due to the unstructured nature of the available information. In the recent years, researchers have provided significant solutions to tackle with the problem of fake news detection, but due to its nature there are still many open issues. In this paper, we have proposed majority voting approach to detect fake news articles. We have used different textual properties of fake and real news. We have used publicly available fake news dataset, comprising of 20,800 news articles among which 10,387 are real and 10,413 are fake news labeled as binary 0 and 1. For the evaluation of our approach, we have used commonly used machine learning classifiers like, Decision Tree, Logistic Regression, XGBoost, Random Forest, Extra Trees, AdaBoost, SVM, SGD and Naive Bayes. Using the aforementioned classifiers, we built a multi-model fake news detection system using Majority Voting technique to achieve the more accurate results. The experimental results show that, our proposed approach achieved accuracy of 96.38%, precision of 96%, recall of 96% and F1-measure of 96%. The evaluation confirms that, Majority Voting technique achieved more acceptable results as compare to individual learning technique.

研究の動機と目的

  • ソーシャルメディアおよびウェブプラットフォームにおける不正なニュースの拡散という増加する課題に対処すること。
  • アンサンブル学習を用いて複数の機械学習分類器を統合することで、検出の正確性を向上させること。
  • 多数決が個々のモデルを上回る不正なニュース検出性能の向上にどの程度有効であるかを評価すること。
  • 公開利用可能なテキスト特徴量と標準的な分類器を用いて、堅牢でスケーラブルなソリューションを提供すること。

提案手法

  • 本研究では、9つの多様な機械学習分類器(決定木、ロジスティック回帰、XGBoost、ランダムフォレスト、エキストラツリー、AdaBoost、SVM、SGD、ナイーブベイズ)を用いたマルチモデルアンサンブル手法を採用する。
  • 各分類器は、20,800件のニュース記事から抽出したテキスト特徴量を用いて学習され、ラベルは0(本物)と1(偽り)の二値である。
  • 全9つの分類器からの予測を統合するために多数決が適用され、最終的な予測は最も多くの票を集めたクラスによって決定される。
  • この手法は、多様なモデルを組み合わせることで分散を低減し、特にノイズが多く構造のないテキストデータにおいて汎化性能を向上させるという原則に基づいている。
  • 評価は、同一のテスト分割を用いて標準的な指標(正確性、適合率、再現率、F1測定)を用いて実施される。

実験結果

リサーチクエスチョン

  • RQ1多様な機械学習分類器のアンサンブルは、個々のモデルと比較して不正なニュース検出の正確性を向上させることができるか?
  • RQ2多数決手法は、不正なニュース検出において複数の分類器からの予測を統合するためにどの程度効果的か?
  • RQ3実世界の不正なニュースデータセットにおいて、多数決を用いて複数の分類器を統合することでどの程度の性能向上が達成されるか?
  • RQ4アンサンブルアプローチは、偽陽性と偽陰性を最小限に抑える一方で、高い適合率と再現率を維持することができるか?

主な発見

  • 提案された多数決アンサンブルモデルは、テストセットで96.38%の正確性を達成した。
  • モデルは96%の適合率を記録し、陽性予測に対する高い信頼性を示した。
  • 再現率は96%であり、全偽りのニュースインスタンスのうち96%が正しく同定されたことを示した。
  • F1測定値は96%に達し、適合率と再現率のバランスの取れた調和平均を反映した。
  • アンサンブルアプローチは、すべての個々の分類器を上回り、多数決によるモデル平均化の有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。