Skip to main content
QUICK REVIEW

[논문 리뷰] "Liar, Liar Pants on Fire": A New Benchmark Dataset for Fake News Detection

William Yang Wang|arXiv (Cornell University)|2017. 05. 01.
Misinformation and Its Impacts인용 수 199
한 줄 요약

본 논문은 12.8K개의 PolitiFact 진술로 구성된 liar 데이터셋을 소개하고, 텍스트와 화자 메타데이터를 융합하는 하이브리드 CNN을 제안하여 세부 등급의 가짜 뉴스 탐지에서 최첨단 성능을 달성합니다.

ABSTRACT

Automatic fake news detection is a challenging problem in deception detection, and it has tremendous real-world political and social impacts. However, statistical approaches to combating fake news has been dramatically limited by the lack of labeled benchmark datasets. In this paper, we present liar: a new, publicly available dataset for fake news detection. We collected a decade-long, 12.8K manually labeled short statements in various contexts from PolitiFact.com, which provides detailed analysis report and links to source documents for each case. This dataset can be used for fact-checking research as well. Notably, this new dataset is an order of magnitude larger than previously largest public fake news datasets of similar type. Empirically, we investigate automatic fake news detection based on surface-level linguistic patterns. We have designed a novel, hybrid convolutional neural network to integrate meta-data with text. We show that this hybrid approach can improve a text-only deep learning model.

연구 동기 및 목표

  • 가짜 뉴스 탐지와 사실 확인 연구를 위한 크고 실제 세계의 라벨링 데이터셋을 제공한다.
  • 짧고 맥락이 풍부한 정치적 진술에 대해 머신러닝 모델을 평가한다.
  • 화자/메타데이터를 텍스트 표현과 통합하여 탐지 성능을 향상시키는 방법을 탐구한다.
  • 다중 클래스 가짜 뉴스 분류를 위한 표면 수준의 언어적 특징의 한계를 벤치마크하고 분석한다.

제안 방법

  • 풍부한 메타데이터를 포함하여 truthfulness로 라벨링된 PolitiFact 진술의 12.8K 데이터셋을 선별한다.
  • 기준선 및 신경망 모델에는 텍스트에 대한 로지스틱 회귀, SVM, Bi-LSTM, CNN이 포함된다.
  • 메타데이터 임베딩을 통해 텍스트 임베딩과 메타데이터를 통합하는 하이브리드 합성곱 신경망(CNN)을 제안한다. 메타데이터 임베딩, 합성곱, 맥스풀링, Bi-LSTM, 최종 소프트맥스 classifier를 포함한다.
  • 텍스트 초기화를 위해 사전 학습된 word2vec(Google News, 300d)를 사용한다.
  • 검증 세트에서 하이퍼파라미터를 조정하고 정확도를 평가 지표로 보고한다.
  • 텍스트 전용 모델과 텍스트+메타데이터 하이브리드 접근법을 비교하여 이득을 평가한다.

실험 결과

연구 질문

  • RQ1짧은 진술을 표면 수준의 언어적 특징을 사용하여 여섯 가지 세밀한 진실성 범주로 얼마나 잘 분류할 수 있는가?
  • RQ2텍스트와 화자/메타데이터를 결합한 신경망 아키텍처가 가짜 뉴스 탐지에서 텍스트 전용 모델보다 더 잘 수행할 수 있는가?
  • RQ3다양한 메타데이터 면모(주제, 화자, 직업, 주, 당, 맥락, 이력)를 통합하는 것이 탐지 정확도에 어떠한 영향을 미치는가?

주요 결과

  • liar 데이터셋은 여섯 가지 세밀한 진실성 라벨을 가진 12.8K개의 진술을 포함한다: pants-fire, false, barely-true, half-true, mostly-true, true.
  • 데이터셋은 광범위한 실제 세계 맥락을 위해 설계되었으며 각 라벨에 대해 자세한 정당화와 소스 링크를 제공한다.
  • 텍스트 전용 CNN은 다른 베이스라인을 상회하고 테스트 세트에서 정확도 0.270을 달성하며 SVM보다 유의하게 우수하다(p<0.0001).
  • 텍스트+메타데이터 하이브리드 CNN은 텍스트 전용 베이스라인을 개선하며, 모든 메타데이터 특징을 사용할 때 가장 좋은 단일 결과는 liar 데이터셋에서 테스트 정확도 0.274를 달성한다.
  • 여러 메타데이터 단일 특징 모델(예: Text+Speaker, Text+Job)은 텍스트 전용 모델보다 개선을 보이며 메타데이터 통합의 이점을 보여준다.
  • 전반적으로 텍스트를 포괄적 메타데이터와 결합하는 것이 테스트 세트에서 가장 강한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.