Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating BERT-based Pre-training Language Models for Detecting Misinformation

Rini Anggrainingsih, Ghulam Mubashar Hassan|arXiv (Cornell University)|Mar 15, 2022
Misinformation and Its Impacts被引用数 5
ひとこと要約

本稿では、事前学習された言語モデルを用いてテキストを密度ベクトルに符号化し、ニューラルネットワークで分類する手法に基づく、BERTに特化した微調整アプローチを提案する。この手法は、短いテキストおよび長いテキストの両方のデータセットで、最先端の手法を上回る性能を示し、より大きな統合データセットで訓練した場合に性能が顕著に向上する。

ABSTRACT

It is challenging to control the quality of online information due to the lack of supervision over all the information posted online. Manual checking is almost impossible given the vast number of posts made on online media and how quickly they spread. Therefore, there is a need for automated rumour detection techniques to limit the adverse effects of spreading misinformation. Previous studies mainly focused on finding and extracting the significant features of text data. However, extracting features is time-consuming and not a highly effective process. This study proposes the BERT- based pre-trained language models to encode text data into vectors and utilise neural network models to classify these vectors to detect misinformation. Furthermore, different language models (LM) ' performance with different trainable parameters was compared. The proposed technique is tested on different short and long text datasets. The result of the proposed technique has been compared with the state-of-the-art techniques on the same datasets. The results show that the proposed technique performs better than the state-of-the-art techniques. We also tested the proposed technique by combining the datasets. The results demonstrated that the large data training and testing size considerably improves the technique's performance.

研究の動機と目的

  • オンラインコンテンツの量と速度に起因する、大規模な誤情報検出の課題に対処すること。
  • 従来のアプローチにおける手動の事実確認と特徴工学の限界を克服すること。
  • BERTベースの事前学習された言語モデルが、誤情報の符号化と分類にどの程度有効であるかを評価すること。
  • 異なるトレーニング可能なパラメータ数を有するBERTバージョン間での性能を比較すること。
  • データセットのサイズとデータの統合が、モデルの汎化性能と正確性に与える影響を評価すること。

提案手法

  • 入力テキストを文脈に応じたベクトル表現に符号化するため、BERTベースの事前学習済み言語モデルを微調整する。
  • 得られたシーケンス表現を、誤情報の二値分類を目的とした全結合ニューラルネットワークに入力する。
  • トレーニング可能なパラメータ数が異なる複数のBERTバージョン(例:base、large)を評価する。
  • 短いテキスト(例:ソーシャルメディア)および長いテキスト(例:ニュース記事)の両方のデータセットでモデルを訓練およびテストする。
  • 複数のデータセットを統合して訓練データのサイズを拡大し、性能の向上を評価する。
  • 標準的な自然言語処理指標(例:正確度、F1スコア)を用いて、最先端の手法と結果を比較する。

実験結果

リサーチクエスチョン

  • RQ1従来の特徴ベース手法と比較して、BERTベースの事前学習された言語モデルは誤情報検出にどの程度効果的か?
  • RQ2トレーニング可能なパラメータ数が異なるさまざまなBERTバージョンにおいて、モデルの性能はどのように変化するか?
  • RQ3複数のデータセットを統合することで、誤情報検出モデルの汎化性能と正確性は向上するか?
  • RQ4訓練データサイズが、BERTベースの分類モデルの性能にどのように影響するか?
  • RQ5提案手法は、短いテキストおよび長いテキストの両方の誤情報検出タスクで、既存の最先端技術を上回ることができるか?

主な発見

  • 提案されたBERTベースの手法は、短いテキストおよび長いテキストの両方のデータセットで、最先端の手法を上回る優れた性能を達成した。
  • データセットの統合による訓練データサイズの拡大に伴い、性能が顕著に向上した。
  • トレーニング可能なパラメータ数が多いより大きなBERTモデルは、より高い分類正確度を示した。
  • モデルは多様なテキスト長にわたり強固な性能を維持したことが示され、入力の多様性に対して耐性があることが裏付けられた。
  • エンドツーエンドの分類に向けたBERTの微調整は、手動による特徴抽出手法よりも効率的かつ正確であった。
  • 結果から、事前学習された言語モデルが、広範な特徴工学を要せずとも、誤情報検出に適した文脈的ヒントを効果的に捉えることができることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。