Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Multi-Source Weak Social Supervision for Early Detection of Fake News

Kai Shu, Guo‐qing Zheng|arXiv (Cornell University)|2020. 04. 03.
Misinformation and Its Impacts인용 수 43
한 줄 요약

본 논문은 제한된 정제 라벨과 다중의 약한 소셜 감독 신호를 함께 활용하여 예측 시점에 소셜 특징을 사용하지 않고도 초기 가짜 뉴스 탐지를 수행하는 MWSS라는 메타학습 프레임워크를 제안합니다.

ABSTRACT

Social media has greatly enabled people to participate in online activities at an unprecedented rate. However, this unrestricted access also exacerbates the spread of misinformation and fake news online which might cause confusion and chaos unless being detected early for its mitigation. Given the rapidly evolving nature of news events and the limited amount of annotated data, state-of-the-art systems on fake news detection face challenges due to the lack of large numbers of annotated training instances that are hard to come by for early detection. In this work, we exploit multiple weak signals from different sources given by user and content engagements (referred to as weak social supervision), and their complementary utilities to detect fake news. We jointly leverage the limited amount of clean data along with weak signals from social engagements to train deep neural networks in a meta-learning framework to estimate the quality of different weak instances. Experiments on realworld datasets demonstrate that the proposed framework outperforms state-of-the-art baselines for early detection of fake news without using any user engagements at prediction time.

연구 동기 및 목표

  • 제한된 주석 데이터로 조기 가짜 뉴스 탐지의 도전을 해결한다.
  • 사용자 참여로부터 다중 약한 소셜 감독 신호를 활용한다.
  • 약한 라벨의 품질/가중치를 추정하는 메타학습 프레임워크를 개발한다.
  • 정제 데이터와 약한 감독의 조합으로 이득을 얻는 가짜 뉴스 분류기를 학습한다.
  • 예측 시점에서 소셜 맥락에 의존하지 않고도 강력한 성능을 가능하게 한다.

제안 방법

  • 정제 신호와 약한 신호에 대한 소스별 예측 헤드를 공유하는 콘텐츠 인코더를 가진 MWSS 프레임워크를 도입한다.
  • 인스턴스 표현과 약한 라벨 임베딩을 기반으로 약한 라벨에 가중치를 부여하는 라벨 가중 네트워크(LWN)를 구현한다.
  • 외부 루프가 정제 데이터의 검증 성능을 향상시키도록 LWN를 최적화하는 이중 최적화 문제를 형식화한다.
  • 정제 데이터 손실과 다중 약한 소스의 가중된 약한 라벨 손실을 결합한 공동 손실을 사용한다.
  • 메타 매개변수 업데이트를 위한 한 단계 SGD 근사와 Adam으로 학습한다.
  • 감정, 편향, 신뢰성 신호를 통해 사회적 참여로부터 약한 라벨을 구성하고 품질을 평가한다.

실험 결과

연구 질문

  • RQ1MWSS가 다중 약한 소셜 감독 소스를 활용해 가짜 뉴스 분류를 개선할 수 있는가?
  • RQ2다양한 약한 감독 소스가 성능에 어떻게 기여하며 MWSS는 다중 약한 신호에 대해 얼마나 강건한가?

주요 결과

  • GossipCop과 PolitiFact에서 정제 데이터와 다중 소스의 결합으로 MWSS가 강력한 기준 모델을 능가한다.
  • 단일 약한 소스는 다중 소스보다 효과가 낮고, MWSS는 소스별 매핑 및 LWN의 이점을 활용한다.
  • MWSS는 L2R 및 Snorkel 기반 기준선 포함 평가 방법들 가운데 일관되게 최상의 통계치를 달성한다.
  • RoBERTa 기반 인코더가 일반적으로 CNN 인코더보다 우수하고, 정제+약한 데이터 사용 시 MWSS가 여전히 선두를 차지한다.
  • 가중치 학습 메커니즘은 더 깔끔한 신호에 더 높은 중요도를 부여하고 약한 소스 간 정보를 보완적으로 활용한다.
  • 정제 대 약한 데이터 비율이 높을수록 MWSS 및 다른 기준선의 성능이 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.