Skip to main content
QUICK REVIEW

[論文レビュー] NoFake at CheckThat! 2021: Fake News Detection Using BERT

Sushma Kumari|arXiv (Cornell University)|Aug 11, 2021
Misinformation and Its Impacts参考文献 18被引用数 12
ひとこと要約

この論文では、事実確認済みの追加データを活用して性能を向上させる、BERTベースのフェイクニュース検出およびドメイン分類のためのモデルを提示している。CheckThat! 2021の評価において、タスク3Aでは83.76%、タスク3Bでは85.55%のマクロF1スコアを達成し、ラベルの統合とドメインに配慮した分類によって一般化性能が向上していることを示している。

ABSTRACT

Much research has been done for debunking and analysing fake news. Many researchers study fake news detection in the last year, but many are limited to social media data. Currently, multiples fact-checkers are publishing their results in various formats. Also, multiple fact-checkers use different labels for the fake news, making it difficult to make a generalisable classifier. With the merge classes, the performance of the machine model can be enhanced. This domain categorisation will help group the article, which will help save the manual effort in assigning the claim verification. In this paper, we have presented BERT based classification model to predict the domain and classification. We have also used additional data from fact-checked articles. We have achieved a macro F1 score of 83.76 % for Task 3Aand 85.55 % for Task 3B using the additional training data.

研究の動機と目的

  • フェイクニュース検出と記事のドメイン分類の両方を統合的に処理できるBERTベースのモデルの開発。
  • 複数の事実確認ソースからの類似するフェイクニュースラベルを統合することで、モデルの一般化性能を向上させること。
  • ドメイン別記事の自動分類により、主張の検証作業における人的作業を削減すること。
  • 事実確認済み記事からの追加学習データを活用して、性能を向上させること。
  • 事実確認プラットフォーム間でのラベル付けの不一致を解消するため、統一された分類フレームワークを構築すること。

提案手法

  • ラベルを統合したマルチラベルフェイクニュースデータセット上で事前学習済みBERTモデルを微調整し、一般化性能を向上させること。
  • モデルの頑健性を高めるために、事実確認済み記事からの追加学習データを統合すること。
  • フェイクニュースの有無と記事のドメインを同時に予測するための統合分類ヘッドを訓練すること。
  • クラスの不均衡を軽減し、多様な事実確認ソース間でのモデル性能を向上させるために、ラベル統合戦略を適用すること。
  • バイナリフェイクニュース検出およびマルチクラスドメイン分類タスクの両方において、主評価指標としてマクロF1スコアを用いること。
  • BERTからのトランスファー学習を活用し、ニューステキストの文脈的・意味的特徴を効果的に捉えること。

実験結果

リサーチクエスチョン

  • RQ1統合されたBERTベースのモデルは、フェイクニュース検出とドメイン分類の両方を効果的に実行できるか?
  • RQ2複数の事実確認ソースからのラベル統合は、モデルの性能と一般化にどのように影響するか?
  • RQ3追加の事実確認済みデータを統合することで、検出精度はどの程度向上するか?
  • RQ4ドメイン分類は、主張検証プロセスにおける人的作業をどの程度軽減できるか?
  • RQ5標準化されたベンチマーク、CheckThat! 2021のタスク3Aおよび3Bにおいて、モデルはどの程度の性能を示すか?

主な発見

  • タスク3A(フェイクニュース検出に特化)において、マクロF1スコア83.76%を達成した。
  • タスク3B(フェイクニュース検出とドメイン分類を含む)において、マクロF1スコア85.55%を達成した。
  • 追加の事実確認済みデータの統合により、両タスクにおけるモデルの性能が顕著に向上した。
  • 事実確認ソース間でのラベル統合が、より良いモデル一般化とクラスの不均衡軽減に寄与した。
  • フェイクニュースの有無とドメインの同時予測により、より効率的でスケーラブルな主張検証ワークフローが実現した。
  • 結果から、ドメインに配慮した分類が、フェイクニュース検出システム全体の効果性を高めることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。