Skip to main content
QUICK REVIEW

[論文レビュー] Utilization of Multinomial Naive Bayes Algorithm and Term Frequency Inverse Document Frequency (TF-IDF Vectorizer) in Checking the Credibility of News Tweet in the Philippines

Neil Christian R. Riego, Danny Bell Villarba|arXiv (Cornell University)|May 30, 2023
Misinformation and Its Impacts被引用数 4
ひとこと要約

本研究では、フィリピン語のニュースツイートの信頼性検出システムを、Multinomial Naive BayesとTF-IDFベクトル化を用いて提案する。正解ラベルが付与されたデータで学習させたモデルは、未学習データで88.98%の正答率を達成したが、F1スコアが89.68%であることに注目すると、誤検出(偽のニュースを真のニュースとして分類)の低減に改善の余地があることが示された。

ABSTRACT

The digitalization of news media become a good indicator of progress and signal to more threats. Media disinformation or fake news is one of these threats, and it is necessary to take any action in fighting disinformation. This paper utilizes ground truth-based annotations and TF-IDF as feature extraction for the news articles which is then used as a training data set for Multinomial Naive Bayes. The model has an accuracy of 99.46% in training and 88.98% in predicting unseen data. Tagging fake news as real news is a concerning point on the prediction that is indicated in the F1 score of 89.68%. This could lead to a negative impact. To prevent this to happen it is suggested to further improve the corpus collection, and use an ensemble machine learning to reinforce the prediction

研究の動機と目的

  • フィリピンのニュースツイートにおけるフェイクニュースを自動で信頼性検出する信頼性の高いシステムの開発。
  • 特にTwitterのようなソーシャルプラットフォーム上で顕著になっているデジタルニュースメディアにおけるフェイクニュースの脅威への対応。
  • ウイルス性のニュースコンテンツの迅速な信頼性評価を可能にすることで、メディアリテラシーの向上と一般の信頼の回復を図る。
  • 低リソースで多言語対応のニュース信頼性検出において、TF-IDF特徴抽出とMultinomial Naive Bayesの組み合わせの有効性の評価。

提案手法

  • 正解ラベルが付与されたニュースツイートのアノテーションを実施し、ラベル付きの学習データセットを構築。
  • 文書頻度逆数(TF-IDF)を適用して、テキストコンテンツを数値特徴に変換。
  • アノテート済みデータセットを用いて、TF-IDFで符号化された特徴量でMultinomial Naive Bayes分類器を学習。
  • 標準的な自然言語処理指標(正答率、適合率、再現率、F1スコア)を用いて、未学習のテストデータに対するモデル性能を評価。
  • 予測誤り、特にフェイクニュースが真のニュースとして誤分類される誤検出の分析。
  • 将来の改善策として、コーパスの強化とアンサンブル学習の提案により、誤分類の低減を図る。

実験結果

リサーチクエスチョン

  • RQ1TF-IDFとMultinomial Naive Bayesの組み合わせは、フィリピンの文脈におけるニュースツイートの信頼性分類においてどれほど有効か?
  • RQ2未学習のニュースツイートを予測する際、モデルの正答率とF1スコアはどの程度か?
  • RQ3なぜモデルは相対的に高い誤検出率(フェイクニュースを真のニュースとして分類)を示すのか?
  • RQ4正解ラベルが付与されたデータは、低リソース環境における信頼性検出モデルの性能向上にどの程度寄与するか?
  • RQ5フェイクニュース信頼性分類における誤検出予測を低減するための方法論的改善策は何か?

主な発見

  • モデルは学習データに対して99.46%の正答率を達成しており、学習データに対する強い適合を示している。
  • 未学習のテストデータに対して、正答率は88.98%に達しており、良好な一般化性能を示している。
  • F1スコアは89.68%であり、適合率と再現率のバランスは中程度であるが、誤検出のリスクが顕著に存在することが示唆されている。
  • 高い誤検出率は、フェイクニュースが真のニュースとして誤って分類されると社会的影響が深刻になるため、重大な制限要因である。
  • 本研究では、コーパスの質とモデルアンサンブル技術が、誤検出の低減に向けた今後の改善分野として特定された。
  • 結果から、フィリピンのような低リソースで多言語対応の文脈において、TF-IDFとMultinomial Naive Bayesを用いた信頼性検出の実現可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。