Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Rumor Detection with Propagation Structure via Prompt Learning

Hongzhan Lin, Pengyao Yi|arXiv (Cornell University)|Dec 2, 2022
Misinformation and Its Impacts被引用数 4
ひとこと要約

本稿では、ラベルなしデータを用いて多言語・多ドメインに跨るフェイクニュース検出を実現するゼロショットフェイクニュース検出フレームワーク、応答認識プロンプト学習(RPL)を提案する。RPLは、配布構造と多言語事前学習言語モデルを活用し、応答スレッド内の構造的位置をモデル化するとともに、仮想的応答増強技術を用いることで、フェイクニュース検出の最先端の性能を達成する。特に、初期フェイクニュース検出において、アラビア語や広東語といった低リソース言語も含む3つの実世界データセットで、既存手法を大きく上回る性能を発揮する。

ABSTRACT

The spread of rumors along with breaking events seriously hinders the truth in the era of social media. Previous studies reveal that due to the lack of annotated resources, rumors presented in minority languages are hard to be detected. Furthermore, the unforeseen breaking events not involved in yesterday's news exacerbate the scarcity of data resources. In this work, we propose a novel zero-shot framework based on prompt learning to detect rumors falling in different domains or presented in different languages. More specifically, we firstly represent rumor circulated on social media as diverse propagation threads, then design a hierarchical prompt encoding mechanism to learn language-agnostic contextual representations for both prompts and rumor data. To further enhance domain adaptation, we model the domain-invariant structural features from the propagation threads, to incorporate structural position representations of influential community response. In addition, a new virtual response augmentation method is used to improve model training. Extensive experiments conducted on three real-world datasets demonstrate that our proposed model achieves much better performance than state-of-the-art methods and exhibits a superior capacity for detecting rumors at early stages.

研究の動機と目的

  • ラベル付きデータが乏しいもしくは存在しない低リソース言語や新規ドメインにおけるフェイクニュース検出の課題に対処すること。
  • タスク固有の微調整に依存するか、伝播ダイナミクスを十分にモデル化できない既存のゼロショットフェイクニュース検出手法の限界を克服すること。
  • 言語固有の文法構造と共有される意味的特徴を分離することで、多言語・多ドメインへの一般化性能を向上させるプロンプト学習フレームワークを開発すること。
  • 応答順序やコミュニティの影響といったドメイン不変の構造的特徴を伝播スレッドからモデル化することで、ドメイン適応性を向上させること。
  • 新規の仮想的応答増強(ViRA)技術を用いて、低リソース環境におけるモデルのロバスト性と学習効率を向上させること。

提案手法

  • 初期主張に対する応答投稿をランク付けすることで、フェイクニュースを伝播スレッドとして表現し、時間的・構造的ダイナミクスを捉える。
  • 多言語事前学習言語モデル(PLM)を用いて、意味的意味と文法的バイアスを分離する階層的プロンプト符号化(HPE)機構を設計する。
  • 絶対的および相対的応答位置を用いて伝播構造をモデル化し、フェイクニュース拡散パターンのドメイン不変特徴を捉える。
  • 低リソース環境での学習を改善するために、現実的な応答シーケンスをシミュレートする仮想的応答増強(ViRA)手法を統合する。
  • 言語やドメインを跨ぐ表現のアライメントを図るためにプロトタイプパラダイム(PV)を採用し、ゼロショット転移性能を向上させる。
  • 言語的特徴抽出と意味的一般化のバランスを取るために、学習可能なレイヤー選択機構を備えたSynEncoderを活用し、6層が最適な性能を示す。

実験結果

リサーチクエスチョン

  • RQ1プロンプトベースのフレームワークは、ラベル付き学習データが一切ない状況下でも、低リソース言語や未学習ドメインにおけるフェイクニュース検出を効果的に可能にするか?
  • RQ2応答順序やコミュニティの影響といった伝播構造特徴は、ゼロショットフェイクニュース検出性能にどのように寄与するか?
  • RQ3仮想的応答増強(ViRA)は、低リソースフェイクニュース検出シナリオにおけるモデルの一般化性能をどの程度向上させるか?
  • RQ4標準的なプロンプトチューニングと比較して、階層的プロンプト符号化は多言語・多ドメイン適応性をどのように向上させるか?
  • RQ5ゼロショットフェイクニュース検出モデルにおいて、言語的特徴抽出と意味的一般化の最適なバランスは何か?

主な発見

  • RPLは、アラビア語や広東語といった低リソース言語も含む3つの実世界フェイクニュース検出ベンチマークで最先端の性能を達成し、WEIBOデータセットではマクロF1が0.664を記録した。
  • CatAr-COVID19データセットでは20件の応答投稿で、Twitter-COVID19データセットでは4時間以内に飽和した初期検出性能に達し、強力な初期検出能力を示した。
  • アブレーションスタディの結果、階層的プロンプト符号化(w/o HPE)を削除すると性能が著しく低下(F1が0.617から0.451に低下)し、意味的知識の保持においてその重要性が確認された。
  • 仮想的応答増強(ViRA)は、入力長制限やノイズの多い応答環境下でもロバスト性を向上させ、アブレーション設定全体で一貫した性能向上が見られた。
  • プロトタイプパラダイム(PV)と応答位置モデリング(RPP)は両者とも不可欠であり、相補的である。いずれかを削除すると性能が著しく低下した。
  • SynEncoderのレイヤー選択解析から、PLMの下位6層を使用すると最適な性能が得られ、言語的特徴抽出と意味的一般化のバランスが最良であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。