Skip to main content
QUICK REVIEW

[논문 리뷰] Linguistic-style-aware Neural Networks for Fake News Detection

Xinyi Zhou, Jiayu Li|arXiv (Cornell University)|2023. 01. 07.
Misinformation and Its Impacts인용 수 5
한 줄 요약

이 논문은 뉴스 기사의 언어학적 구조를 가진 트리로 모델링하여 어휘 사용, 문법적 재귀, 논의 조직의 스타일적 차이를 포착함으로써 가짜 뉴스를 탐지하는 계층적 재귀 신경망인 HERO를 제안한다. 전역적 언어학적 트리 구조를 유지함으로써 실세계 데이터셋에서 AUC 점수 0.87–0.90을 기록하며 최신 기법들을 능가하며, 가짜 뉴스는 진실된 내용보다 더 복잡한 문법적 구조와 더 단순한 논의 패턴을 보임을 드러낸다.

ABSTRACT

We propose the hierarchical recursive neural network (HERO) to predict fake news by learning its linguistic style, which is distinguishable from the truth, as psychological theories reveal. We first generate the hierarchical linguistic tree of news documents; by doing so, we translate each news document's linguistic style into its writer's usage of words and how these words are recursively structured as phrases, sentences, paragraphs, and, ultimately, the document. By integrating the hierarchical linguistic tree with the neural network, the proposed method learns and classifies the representation of news documents by capturing their locally sequential and globally recursive structures that are linguistically meaningful. It is the first work offering the hierarchical linguistic tree and the neural network preserving the tree information to our best knowledge. Experimental results based on public real-world datasets demonstrate the proposed method's effectiveness, which can outperform state-of-the-art techniques in classifying short and long news documents. We also examine the differential linguistic style of fake news and the truth and observe some patterns of fake news. The code and data have been publicly available.

연구 동기 및 목표

  • 기존의 가짜 뉴스 탐지 기법들이 어휘 단위, 어구, 문장, 단락과 같은 언어 단위 간의 계층적 구조적 관계를 忽略하는 한계를 해결하기 위해.
  • 재귀적 문법적 및 논의적 구조를 인코딩하는 계층적 언어학적 트리 기반의 뉴스 기사 표현 방식을 개발하여 국소적 및 전역적 언어학적 의미를 모두 유지하기 위해.
  • 심리학적 위선 이론에 기반하여 진실된 내용과 구별되는 스타일 패턴을 포착함으로써 가짜 뉴스를 분류할 수 있도록, 이러한 트리에서 학습하는 계층적 신경망 아키텍처—HERO—를 설계하기 위해.
  • 공개된 실세계 데이터셋을 사용하여 짧은 문장과 긴 뉴스 기사 양쪽 모두에서 제안된 방법의 효과성을 실증적으로 검증하기 위해.
  • 계층적 언어학적 트리의 구조적 특성을 분석하여 가짜 뉴스와 진실된 내용 간의 차별적 언어학적 스타일을 규명하기 위해.

제안 방법

  • 어휘, 어구, 문장, 단락과 같은 언어 단위 간의 계층적 관계를 반복적으로 분해하여 뉴스 기사의 계층적 언어학적 트리를 구성함으로써, 어휘 수준에서 문서 수준까지의 재귀적 구조를 포착하기 위해.
  • 전역 트리 위상, 즉 부모-자식 관계와 노드 속성까지 포함된 구조적 연결성을 유지하고 학습할 수 있도록, 새로운 신경망 아키텍처—HERO—의 입력으로 계층적 언어학적 트리를 사용하기 위해.
  • 하향식 재귀 신경망 메커니즘을 적용하여 자식 노드의 특징을 조합하여 부모 노드의 표현을 구성함으로써, 계층적이고 언어학적으로 의미 있는 표현을 학습할 수 있도록 하기 위해.
  • 어휘, 문법, 논의 수준의 다양한 언어학적 수준을 통합된 트리 구조로 통합하여, 노드가 어휘, 품사 태그, EDU, 논의 관계(RR), 그리고 루트가 전체 문서를 나타내도록 하기 위해.
  • 노드의 내용과 트리 내의 구조적 연결성을 모두 활용하여, 교차 엔트로피 손실을 사용해 엔드 투 엔드로 HERO 모델을 훈련시켜 뉴스 기사를 가짜 또는 진실로 분류하기 위해.
  • 트리 구조나 계층적 학습을 제거한 변형 모델들과 비교하여, 계층적 설계의 기여도를 분석하기 위해 아블레이션 실험을 수행하기 위해.
Figure 1: The hierarchical linguistic tree for the news piece “Why did the US in 2017 give $3.7m to the Wuhan Lab in China? Such grants were prohibited in 2014. Did President Obama grant an exception?” verified as a false statement by PolitiFact. 3 3 3 Source: https://www.politifact.com/factchecks/2
Figure 1: The hierarchical linguistic tree for the news piece “Why did the US in 2017 give $3.7m to the Wuhan Lab in China? Such grants were prohibited in 2014. Did President Obama grant an exception?” verified as a false statement by PolitiFact. 3 3 3 Source: https://www.politifact.com/factchecks/2

실험 결과

연구 질문

  • RQ1가짜 뉴스와 진실된 뉴스 간의 계층적 언어학적 트리의 구조적 특성은 어떻게 다를까?
  • RQ2전역적 계층적 구조를 유지하는 신경망이 기존 모델 대비 가짜 뉴스 탐지 성능을 향상시킬 수 있는가?
  • RQ3어휘 사용, 문법 복잡성, 논의 조직과 같은 특정 언어학적 스타일 패턴 중에서 가짜 뉴스와 항상 관련된 것은 무엇인가?
  • RQ4제안된 HERO 모델은 짧은 문장과 장문의 뉴스 기사 양쪽 모두에서 일반화되는가?
  • RQ5지역 빈도 기반 특징을 초월하여 계층적 언어학적 구조는 어느 정도 탐지 성능 향상에 기여하는가?

주요 결과

  • HERO는 공개 데이터셋에서 AUC 점수 0.87–0.90를 기록하며, 순환, 컨볼루션, 그래프, 자기주의 어텐션 네트워크를 포함한 최신 기법들을 능가하며 짧은 문장과 장문의 기사 모두에서 가짜 뉴스 탐지에 성공한다.
  • 가짜 뉴스 기사의 계층적 언어학적 트리에서는 진실된 내용보다 부모 노드당 자식 노드의 수가 유의미하게 많으며, 이는 더 높은 문법적 복잡성을 시사한다.
  • 가짜 뉴스의 문법 수준 트리는 진실된 뉴스보다 크고 깊으며, 더 넓은 범위를 가짐으로써 더 많은 잎 노드를 포함하고 있어, 더 길고 더 복잡한 기본 논의 단위(EDU)를 의미한다.
  • 가짜 뉴스는 EDU 및 복수 명사(NNS) 노드의 비율이 유의미하게 낮지만, 전치사(IN), 관형사(DT), 전치사 구문(PP)의 비율은 더 높아, 다른 문법적 패턴을 보임을 시사한다.
  • 가짜 뉴스의 논의 수준 트리는 진실된 뉴스보다 더 작고 얕으며, 더 좁은 범위를 가지며, 특히 짧은 문장에서 더 단순하고 산산이 찢어진 고위 조직 구조를 보임을 시사한다.
  • 언어학적 트리의 계층적 구조는 탐지에 있어 핵심 요소이며, 아블레이션 실험 결과 트리 구조나 계층적 학습을 제거하면 성능이 유의미하게 떨어짐을 확인했다.
Figure 2: Framework overview, which contains a top-bottom building process of hierarchical linguistic trees, a bottom-top feature extraction process using the proposed hierarchical recursive neural network, and a classifier to predict fake news. The neural network’s architecture adaptively preserves
Figure 2: Framework overview, which contains a top-bottom building process of hierarchical linguistic trees, a bottom-top feature extraction process using the proposed hierarchical recursive neural network, and a classifier to predict fake news. The neural network’s architecture adaptively preserves

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.