Skip to main content
QUICK REVIEW

[논문 리뷰] Limiting the Spread of Fake News on Social Media Platforms by Evaluating Users' Trustworthiness

Oana Balmau, Rachid Guerraoui|arXiv (Cornell University)|2018. 08. 29.
Misinformation and Its Impacts참고 문헌 41인용 수 5
한 줄 요약

Credulix는 사실 확인된 기사들에 대한 사용자 과거 공유 행동을 기반으로 뉴스 기사의 신뢰성을 평가함으로써 소셜 미디어에서 가짜 뉴스 확산을 제한하는 콘텐츠 무관 시스템이다. 사용자 신뢰성 기록을 베이지안 프레임워크로 분석하여, 0%의 거짓 양성 결과를 동반하면서도 99% 이상의 가짜 뉴스를 식별하며, 사용자 작업에 대해 3% 미만의 지연 시간 오버헤드와 8% 이내의 처리량 영향을 미친다.

ABSTRACT

Today's social media platforms enable to spread both authentic and fake news very quickly. Some approaches have been proposed to automatically detect such "fake" news based on their content, but it is difficult to agree on universal criteria of authenticity (which can be bypassed by adversaries once known). Besides, it is obviously impossible to have each news item checked by a human. In this paper, we a mechanism to limit the spread of fake news which is not based on content. It can be implemented as a plugin on a social media platform. The principle is as follows: a team of fact-checkers reviews a small number of news items (the most popular ones), which enables to have an estimation of each user's inclination to share fake news items. Then, using a Bayesian approach, we estimate the trustworthiness of future news items, and treat accordingly those of them that pass a certain "untrustworthiness" threshold. We then evaluate the effectiveness and overhead of this technique on a large Twitter graph. We show that having a few thousands users exposed to one given news item enables to reach a very precise estimation of its reliability. We thus identify more than 99% of fake news items with no false positives. The performance impact is very small: the induced overhead on the 90th percentile latency is less than 3%, and less than 8% on the throughput of user operations.

연구 동기 및 목표

  • 콘텐츠 기반 검출이 신뢰할 수 없고, 대규모로 인간의 사실 확인이 불가능한 소셜 미디어 플랫폼에서 바이러스성 가짜 뉴스를 방지하는 과제를 해결한다.
  • 기존 인간의 사실 확인 작업을 활용하면서 콘텐츠 분석이나 사용자 레이블링이 필요 없는 확장성 있고 구현 가능한 시스템을 개발한다.
  • 소셜 미디어 플랫폼에서 높은 정확도를 유지하면서도 성능 오버헤드를 최소화한다.
  • 검증된 사실 확인 기반의 행동 신뢰 지표를 활용해 소셜 네트워크가 바이러스성 확산 이전에 가짜 뉴스를 사전 차단할 수 있도록 한다.
  • 특정 언어나 의미적 특징에 의존하지 않는 일반적이고 플러그인 방식의 솔루션을 제공하여 기존 콘텐츠 기반 검출 방법과 보완한다.

제안 방법

  • 사용자 신뢰성 기록(UCRs)을 수집하기 위해 사실 확인된 뉴스 기사들을 조회하거나 공유한 사용자를 추적함으로써, 사용자 신뢰성의 기초를 확립한다.
  • 라플라스의 성공률 법칙을 적용하여, 이력 기반으로 사용자가 가짜 뉴스를 공유할 가능성을 사전 확률로 추정한다.
  • 베이즈 정리(베이즈 정리)를 사용하여, 특정 뉴스 기사가 가짜일 가능성의 사후 확률을 계산한다. 이는 해당 기사를 공유한 사용자 집합을 기반으로 한다.
  • 신뢰성 기준을 정의한다(예: 99.9999%), 이를 초과하면 기사가 불신뢰성으로 간주되어 확산이 차단된다.
  • 소셜 미디어 플랫폼에 플러그인 형태로 통합하여, 콘텐츠 분석과 사용자 피드백 또는 태깅 없이 독립적으로 작동한다.
  • 콘도르세의 법정 이론의 정신을 따르며, 많은 사용자로부터의 약한 신호를 집계하여 가짜 뉴스 검출의 높은 집단적 신뢰성을 달성한다.

실험 결과

연구 질문

  • RQ1콘텐츠에 관계없이 사용자 사실 확인된 기사에 대한 공유 행동만을 기반으로 하는 시스템이 가짜 뉴스의 확산을 효과적으로 탐지하고 제한할 수 있는가?
  • RQ2베이지안 모델이 공유한 사용자들의 신뢰성에 기반해 뉴스 기사가 가짜일 가능성을 얼마나 정확히 추정할 수 있는가?
  • RQ3이러한 시스템을 테이터 트위터와 같은 대규모 소셜 네트워크에 구현할 경우 성능 오버헤드는 어느 정도인가?
  • RQ4소수의 사실 확인된 바이러스성 기사들로 인해, 대량의 새로운 뉴스 기사들에 대한 신뢰성 평가를 얼마나 정확히 할 수 있는가?
  • RQ5실제 운영 환경에서 이 시스템이 거짓 양성 결과가 전혀 없는 near-perfect 가짜 뉴스 검출을 달성할 수 있는가?

주요 결과

  • 실제로 4,100만 명의 사용자를 포함한 트위터 그래프에 적용했을 때, Credulix는 99% 이상의 가짜 뉴스 기사들을 식별하면서도 거짓 양성 결과가 전혀 없었다.
  • 해당 뉴스 기사에 노출된 사용자가 수천 명 정도만 되어도 높은 정확도로 기사의 신뢰성을 정확히 추정할 수 있었다.
  • 성능 오버헤드는 극히 미미했다: 90번째 백분위수 지연 시간은 3% 미만으로 증가했으며, 부하가 가해진 상황에서 처리량은 8% 이내로 감소했다.
  • 베이지안 모델은 콘텐츠 분석이나 언어적 특징에 의존하지 않고 사용자 행동을 집계하여 뉴스 기사의 신뢰성 여부를 효과적으로 추론했다.
  • 이 방법은 강건하고 확장 가능했으며, 사실 확인자가 모든 콘텐츠를 검토할 필요 없이 가장 바이러스성인 기사들만 검토하면 되기 때문이다.
  • Credulix는 기존의 콘텐츠 기반 검출 시스템을 보완하며, 핵심 소셜 미디어 인프라에 대한 변경 없이 플러그인 방식으로 배포할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.