Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Generalizability of Fake News Detection Methods using Propensity Score Matching

Bo Ni, Zhichun Guo|arXiv (Cornell University)|2020. 01. 28.
Misinformation and Its Impacts참고 문헌 20인용 수 13
한 줄 요약

이 논문은 특성 선택에 Propensity Score Matching (PSM)를 사용하여 혼동 변수 편향을 줄이고 모델의 일반화 능력을 향상시키기 위해 제안한다. 기존의 문서 빈도 기반 특성 선택 방식을 대체하여 PSM을 적용함으로써 더 인과적으로 관련성이 높은 특성을 식별하게 되어, 로지스틱 회귀, 랜덤 포레스트, SVM 등 다양한 분류기에서 교차 데이터셋 성능이 크게 향상된다.

ABSTRACT

Recently, due to the booming influence of online social networks, detecting fake news is drawing significant attention from both academic communities and general public. In this paper, we consider the existence of confounding variables in the features of fake news and use Propensity Score Matching (PSM) to select generalizable features in order to reduce the effects of the confounding variables. Experimental results show that the generalizability of fake news method is significantly better by using PSM than using raw frequency to select features. We investigate multiple types of fake news methods (classifiers) such as logistic regression, random forests, and support vector machines. We have consistent observations of performance improvement.

연구 동기 및 목표

  • 가짜 뉴스 코퍼스에서 특성 선택에 영향을 주는 혼동 변수 문제를 해결하고 모델의 일반화 능력을 저하시키는 것을 목표로 한다.
  • 학습 및 테스트 데이터셋 간 분포가 다를 경우에도 가짜 뉴스 탐지 모델의 일반화 능력을 향상시키는 것을 목표로 한다.
  • 가짜 뉴스와의 인과적 관련성이 높은 특성을 추출하고 순수 상관관계가 아닌 특성 선택 기반의 인과 추론 기반 특성 선택 방법을 개발하는 것을 목표로 한다.
  • PSM 기반 특성 선택이 로지스틱 회귀, 랜덤 포레스트, SVM 등 다양한 기계 학습 모델에서 일관되게 성능 향상을 이끌어내는지 확인하는 것을 목표로 한다.
  • 가짜 뉴스 탐지 연구의 일반화를 지원하기 위해 오픈소스 데이터셋(FakeNewsNet)과 코드를 활용한 재현 가능한 프레임워크를 제공하는 것을 목표로 한다.

제안 방법

  • 관측된 공변량을 기반으로 뉴스 기사가 가짜일 확률을 모델링하여 특성을 선택하기 위해 Propensity Score Matching (PSM)를 적용한다.
  • 로지스틱 회귀를 사용해 손실 점수를 추정하며, 이는 기사의 특성에 기반해 해당 기사가 가짜로 레이블링될 가능성을 나타낸다.
  • 유사한 손실 점수를 가진 가짜 및 진짜 뉴스 기사를 매칭하여 균형 잡히고 혼동 변수가 감소된 훈련 세트를 생성한다.
  • 매칭된 쌍 내에서 안정성과 예측 능력에 기반해 특성을 선택하며, 균형 잡힌 샘플 전반에서 일관되게 가짜 뉴스와 관련된 특성을 우선시한다.
  • 다양한 분류기와 데이터셋에서 PSM 기반 특성 선택을 기존의 문서 빈도 기반 선택과 비교한다.
  • 교차 데이터셋 테스트에서 일반화 능력을 측정하기 위해 AUROC 점수를 사용해 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1Propensity Score Matching은 다양한 데이터 분포 간에 가짜 뉴스 탐지 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ2PSM 기반 특성 선택은 기존의 문서 빈도 기반 특성 선택에 비해 교차 데이터셋 성능에서 어떻게 비교되는가?
  • RQ3PSM와 문서 빈도 방식에서 선택된 특성 유형은 무엇이며, 그 일반화 특성은 어떻게 다를까?
  • RQ4PSM 사용이 데이터셋 특유의 편향에 덜 민감하고 더 안정적이며 인과적으로 관련성이 높은 특성 집합을 도출하는가?
  • RQ5PSM 기반 특성 선택은 로지스틱 회귀, 랜덤 포레스트, SVM 등 다양한 기계 학습 모델에서 일관되게 성능 향상을 이끌어낼 수 있는가?

주요 결과

  • PSM 기반 특성 선택은 모델의 일반화 능력을 크게 향상시키며, PolitiFact에서 훈련한 경우 GossipCop 데이터셋에서 AUROC 점수가 기준값 0.56에서 0.68로 상승한다.
  • PolitiFact 데이터셋에서 PSM 방법은 기준값 0.63에 비해 AUROC 0.67을 기록하여 다양한 데이터셋에서 일관된 향상을 보였다.
  • PSM가 선별한 상위 특성들 — 예를 들어 'confirmed', 'inside', 'makes', 'leaves' — 는 더 일반화 가능하며 가짜 뉴스의 구조적 패턴을 반영하지만, 문서 빈도 방식은 'trump'와 'obama'와 같은 주제 중심의 용어를 선택한다.
  • 작은 특성 집합에서 PSM과 기준값 간의 성능 격차가 가장 두드러지며, 이는 PSM이 더 정보량이 많고 안정적인 특성을 선택한다는 것을 시사한다.
  • PSM의 성능 향상은 로지스틱 회귀, 랜덤 포레스트, SVM 등 여러 분류기에서 일관되게 관찰되어 그 강건성을 확인한다.
  • 실증 분석을 통해 PSM이 데이터셋 특유의 편향을 줄임을 확인하였으며, PSM을 통해 선택된 특성들은 특정 코퍼스의 주요 주제에 덜 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.