Skip to main content
QUICK REVIEW

[論文レビュー] Linguistic-style-aware Neural Networks for Fake News Detection

Xinyi Zhou, Jiayu Li|arXiv (Cornell University)|Jan 7, 2023
Misinformation and Its Impacts被引用数 5
ひとこと要約

本稿では、語の使用、句構造の再帰的性質、話法的組織の差を捉えることでフェイクニュースを検出する、言語的構造を持つ木構造でニュース記事をモデル化する階層的再帰的ニューラルネットワークであるHEROを提案する。HEROは、グローバルな言語的木構造を保持することで、フェイクニュースは真実のコンテンツよりもより複雑な句構造とより単純な話法的パターンを示すという事実を明らかにし、実世界のデータセット上でAUCスコア0.87〜0.90を達成し、最先端手法を上回る性能を発揮する。

ABSTRACT

We propose the hierarchical recursive neural network (HERO) to predict fake news by learning its linguistic style, which is distinguishable from the truth, as psychological theories reveal. We first generate the hierarchical linguistic tree of news documents; by doing so, we translate each news document's linguistic style into its writer's usage of words and how these words are recursively structured as phrases, sentences, paragraphs, and, ultimately, the document. By integrating the hierarchical linguistic tree with the neural network, the proposed method learns and classifies the representation of news documents by capturing their locally sequential and globally recursive structures that are linguistically meaningful. It is the first work offering the hierarchical linguistic tree and the neural network preserving the tree information to our best knowledge. Experimental results based on public real-world datasets demonstrate the proposed method's effectiveness, which can outperform state-of-the-art techniques in classifying short and long news documents. We also examine the differential linguistic style of fake news and the truth and observe some patterns of fake news. The code and data have been publicly available.

研究の動機と目的

  • 語、句、文、段落などの言語的単位間の階層的構造的関係を無視する既存のフェイクニュース検出手法の限界を解決すること。
  • 局所的およびグローバルな言語的意味を保持する、再帰的句構造および話法的構造をエンコードする階層的言語的木構造に基づく、ニュース記事の新しい表現を構築すること。
  • 心理的欺瞞理論を根拠に、フェイクニュースと真実のコンテンツを区別できるスタイル的パターンを捉えるために、階層的構造を考慮したニューラルネットワークアーキテクチャ—HERO—を設計すること。
  • 公開された実世界のデータセットを用いて、短い文と長文の両方のニュース記事に対して、提案手法の有効性を実証的に検証すること。
  • 階層的言語的木構造の構造的特性を分析することで、フェイクニュースと真実のコンテンツの間の言語的スタイルの差を特定すること。

提案手法

  • 語のレベルからドキュメントレベルまで再帰的に分解することで、話法的単位(EDU)、品詞(POS)、語を含む階層的言語的木を構築し、語からドキュメントまでの再帰的構造を捉える。
  • HEROと呼ばれる新しいニューラルネットワークアーキテクチャの入力構造として、親子関係やノード属性を含むグローバルな木のトポロジーを保持する。
  • 下位から上位への再帰的ニューラルネットワーク機構を適用し、子ノードの特徴を組み合わせて親ノードの表現を生成することで、階層的かつ言語的に意味のある表現を学習可能にする。
  • 語彙的、構文的、話法的といった複数の言語的レベルを統合した一貫した木構造に統合し、ノードは語、品詞タグ、EDU、修辞的関係(RR)、およびルートは完全なドキュメントを表す。
  • ノードの内容と木構造の接続性の両方を活用して、クロスエントロピー損失を用いてエンド・ツー・エンドでHEROモデルを訓練し、フェイクまたは真実のニュースに分類する。
  • 木構造や階層的学習を削除したバリアントと比較することで、階層的設計の貢献度をアブレーション解析する。
Figure 1: The hierarchical linguistic tree for the news piece “Why did the US in 2017 give $3.7m to the Wuhan Lab in China? Such grants were prohibited in 2014. Did President Obama grant an exception?” verified as a false statement by PolitiFact. 3 3 3 Source: https://www.politifact.com/factchecks/2
Figure 1: The hierarchical linguistic tree for the news piece “Why did the US in 2017 give $3.7m to the Wuhan Lab in China? Such grants were prohibited in 2014. Did President Obama grant an exception?” verified as a false statement by PolitiFact. 3 3 3 Source: https://www.politifact.com/factchecks/2

実験結果

リサーチクエスチョン

  • RQ1フェイクニュースと真実のニュースの間で、階層的言語的木構造の構造的特性はどのように異なるか?
  • RQ2グローバルな階層的構造を保持するニューラルネットワークは、既存のモデルと比較してフェイクニュース検出性能を向上させられるか?
  • RQ3語の使用、構文的複雑さ、話法的組織といった、フェイクニュースと関連が深い特定の言語的スタイルのパターンは何か?
  • RQ4提案されたHEROモデルは、短い文と長文の両方のニュース記事に一般化可能か?
  • RQ5局所的な頻度ベースの特徴を超えて、階層的言語的構造はどれほど検出性能の向上に寄与するか?

主な発見

  • HEROは、公開データセットでAUCスコア0.87〜0.90を達成し、短い文と長文の両方のフェイクニュース検出において、再帰的・畳み込み的・グラフ的・自己注意型ネットワークを含む最先端手法を上回る性能を発揮する。
  • フェイクニュースは真実のコンテンツと比較して、親ノードあたりの子ノード数が顕著に多いことが判明し、より複雑な構文的構造を示している。
  • フェイクニュースの構文レベルの木構造は、真実のニュースと比較してより大きく、深く、広く、葉ノードの数も多いため、より長く複雑な基本的話法単位(EDU)を示している。
  • フェイクニュースではEDUノードおよび複数形名詞(NNS)ノードの割合が顕著に低く、逆に前置詞(IN)、限定語(DT)、前置詞句(PP)の割合が高いことが判明し、特徴的な構文的パターンを示している。
  • フェイクニュースの話法レベルの木構造は、真実のニュースと比較してより小さく、狭く、高レベルの組織が単純で断片的であることを示しており、特に短い文において顕著である。
  • 言語的木構造の階層的構造は、検出に重要な要因である。アブレーションスタディの結果、木構造や階層的学習を削除すると性能が顕著に低下することが明らかになった。
Figure 2: Framework overview, which contains a top-bottom building process of hierarchical linguistic trees, a bottom-top feature extraction process using the proposed hierarchical recursive neural network, and a classifier to predict fake news. The neural network’s architecture adaptively preserves
Figure 2: Framework overview, which contains a top-bottom building process of hierarchical linguistic trees, a bottom-top feature extraction process using the proposed hierarchical recursive neural network, and a classifier to predict fake news. The neural network’s architecture adaptively preserves

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。