Skip to main content
QUICK REVIEW

[논문 리뷰] FACTOID: A New Dataset for Identifying Misinformation Spreaders and Political Bias

Flora Sakketou, Joan Plepi|arXiv (Cornell University)|2022. 05. 11.
Misinformation and Its Impacts인용 수 8
한 줄 요약

이 논문은 4,150명 이상의 사용자와 340만 건 이상의 게시물이 포함된 새로운 Reddit 기반 데이터셋 FACTOID을 소개한다. 이 데이터셋은 사용자의 장기적 게재 행동, 신뢰성 수준(매우 낮음에서 매우 높음), 정치적 편향(극좌에서 극우)을 포괄한다. 연구에서는 사회적 상호작용과 심리언어적 특징—특히 정서적 정서적 과정과 경험 수용성—을 활용하는 그래프 주의 메커니즘(GAT) 모델을 제안하여 가짜 뉴스 유포자를 탐지함으로써 최신 기술 수준의 성능을 달성한다. GAT 모델은 모든 기준 모델을 능가한다.

ABSTRACT

Proactively identifying misinformation spreaders is an important step towards mitigating the impact of fake news on our society. In this paper, we introduce a new contemporary Reddit dataset for fake news spreader analysis, called FACTOID, monitoring political discussions on Reddit since the beginning of 2020. The dataset contains over 4K users with 3.4M Reddit posts, and includes, beyond the users' binary labels, also their fine-grained credibility level (very low to very high) and their political bias strength (extreme right to extreme left). As far as we are aware, this is the first fake news spreader dataset that simultaneously captures both the long-term context of users' historical posts and the interactions between them. To create the first benchmark on our data, we provide methods for identifying misinformation spreaders by utilizing the social connections between the users along with their psycho-linguistic features. We show that the users' social interactions can, on their own, indicate misinformation spreading, while the psycho-linguistic features are mostly informative in non-neural classification settings. In a qualitative analysis, we observe that detecting affective mental processes correlates negatively with right-biased users, and that the openness to experience factor is lower for those who spread fake news.

연구 동기 및 목표

  • 가짜 뉴스 탐지에서 장기적 사용자 행동, 신뢰성, 정치적 편향을 통합한 사용자 수준의 데이터셋 부족 문제를 해결하기 위해.
  • 세분화된 신뢰성 및 정치적 편향 점수를 제공하는 벤치마크 데이터셋을 구축하여 가짜 뉴스를 유포하는 사용자와 신뢰할 수 있는 뉴스를 유포하는 사용자를 식별하기 위해.
  • 사회 네트워크 구조와 심리언어적 특징이 가짜 뉴스 유포자 행동을 예측하는 데 어떻게 기여하는지 조사하기 위해.
  • 정서적 정서적 과정과 경험 수용성 등의 심리적 특성과 가짜 뉴스 공유 간의 관계를 탐색하기 위해.

제안 방법

  • FACTOID 데이터셋은 2020년 1월부터 2021년 4월까지 정치적 논의에 활발히 참여한 4,150명의 사용자로부터 수집된 Reddit 게시물을 포함하며, 그래프 모델링을 위해 스레드 구조를 유지한다.
  • 사용자는 이진 가짜 뉴스 유포자 상태, 세분화된 신뢰성(1–5 척도), 정치적 편향(−3에서 +3, 극좌에서 극우)으로 레이블링된다.
  • 사용자 간의 사회적 상호작용을 모델링하기 위해 그래프 주의 메커니즘(GAT)을 사용하여 네트워크 구조만으로도 가짜 뉴스 유포 행동을 예측할 수 있는지 분석한다.
  • LIWC(정서적 정서적 과정 분석용)와 BFM(성격 특성 분석용)을 사용하여 심리언어적 특징을 추출하며, 경험 수용성과 정서적 이질성 등 포함.
  • 콘텐츠 특징(리스트 기반: LIWC, BFM), 통합 특징, 그래프 기반 모델(GAT)을 사용한 모델을 비교하여 성능 평가.
  • 5겹 교차검증을 통해 각 특징 집합이 탐지 성능에 기여하는 정도를 평가하기 위해 추론 실험을 수행한다.

실험 결과

연구 질문

  • RQ1콘텐츠 특징과 무관하게 사회적 네트워크 상호작용만으로도 사용자가 가짜 뉴스 유포자인지 예측할 수 있는가?
  • RQ2정서적 정서적 과정과 경험 수용성 등의 심리언어적 특징이 정치적 편향과 가짜 뉴스 유포에 어떻게 관련되는가?
  • RQ3이진 레이블 외에 신뢰성 및 정치적 편향 점수를 추가로 제공할 경우, 가짜 뉴스 유포자 탐지 성능이 얼마나 향상되는가?
  • RQ4LIWC, BFM, 또는 둘 다의 조합 중에서 어느 것이 가짜 뉴스 유포자 탐지 및 정치적 편향 탐지에서 가장 높은 F1 스코어를 달성하는가?
  • RQ5그래프 주의 메커니즘(GAT)이 전통적 분류기보다 사회적 네트워크 구조를 기반으로 가짜 뉴스 유포자를 식별하는 데 더 뛰어나게 성능을 발휘하는가?

주요 결과

  • GAT 모델은 모든 기준 모델을 능가하여 가짜 뉴스 유포자 탐지에서 최고의 성능을 보였으며, 사회적 상호작용만으로도 효과적으로 가짜 뉴스 유포 행동을 예측할 수 있음을 입증했다.
  • 정서적 정서적 과정, 특히 불안과 분노와 같은 부정적 정서는 우익 편향을 가진 사용자에서 유의미하게 낮게 나타나 정치적 극단주의와 음의 상관관계를 보였다.
  • 가짜 뉴스 유포자들은 경험 수용성이 항상 낮게 나타나, 다른 시각에 대한 인지적 개방성이 떨어져 있음을 시사한다.
  • BFM 기반 특징(특히 경험 수용성)은 LIWC 특징보다 가짜 뉴스 유포자 탐지에 더 효과적이었으며, 정치적 편향 탐지에서는 임bedding 기반 특징이 어휘 기반 특징보다 성능이 뛰어났다.
  • LIWC와 BFM 특징의 조합이 로지스틱 회귀를 사용할 때 가장 높은 F1 스코어(63.9%)를 기록하여 상호보완적 가치를 입증했다.
  • 데이터셋은 스레드 구조를 유지하고 있으며 그래프 기반 모델링을 가능하게 하여 고립된 게시물 수준 분석보다 사용자 상호작용을 더 현실적으로 표현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.