Skip to main content
QUICK REVIEW

[논문 리뷰] Reputation Systems for News on Twitter: A Large-Scale Study

Luca de Alfaro, Massimo Di Pierro|arXiv (Cornell University)|2018. 02. 22.
Misinformation and Its Impacts참고 문헌 11인용 수 7
한 줄 요약

이 논문은 주류 언론 매체에서 <1%의 극히 낮은 거짓 경고 비율을 유지하면서도 사용자 신원과 기사 본문 특징을 활용해 트위터에서 위성 또는 오락성 뉴스를 높은 정확도로 탐지할 수 있는 신뢰도 시스템을 제안한다. 연구는 사용자 행동 및 콘텐츠 메타데이터를 기반으로 훈련된 단순한 로지스틱 회귀 모델이 고도로 확산되는 가짜 뉴스의 85% 이상을 식별할 수 있음을 보여주며, 신뢰할 수 있는 출처에 대해서도 뛰어난 신뢰성을 유지한다.

ABSTRACT

Social networks offer a ready channel for fake and misleading news to spread and exert influence. This paper examines the performance of different reputation algorithms when applied to a large and statistically significant portion of the news that are spread via Twitter. Our main result is that simple algorithms based on the identity of the users spreading the news, as well as the words appearing in the titles and descriptions of the linked articles, are able to identify a large portion of fake or misleading news, while incurring only very low (&lt;1%) false positive rates for mainstream websites. We believe that these algorithms can be used as the basis of practical, large-scale systems for indicating to consumers which news sites deserve careful scrutiny and skepticism.

연구 동기 및 목표

  • 대규모 실세계 트위터 데이터셋에서 신뢰도 알고리즘의 가짜 또는 오락성 뉴스 탐지 성능을 평가하기 위해.
  • 초기 훈련 데이터에 포함되지 않은 알려지지 않은 저질 뉴스 사이트에 대해 이러한 시스템이 얼마나 잘 일반화되는지 평가하기 위해.
  • 사용자 신뢰를 확보하기 위해 핵심적인 요소인 신뢰할 수 있는 주류 뉴스 출처에서의 거짓 경고 비율을 최소화하기 위해.
  • 사람의 사실 확인 이전에 신뢰도 시스템을 활용해 의심스러운 뉴스 사이트를 탐지할 수 있는지의 가능성 탐색을 위해.

제안 방법

  • 저자들은 주류 언론 매체, 동료 검토 논문, 알려진 저질 사이트에서 온 550만 건의 뉴스 기사, 8800만 건의 트윗, 900만 명의 사용자를 포함한 데이터셋을 수집했다.
  • 세 가지의 신뢰도 알고리즘을 평가했다: 사용자 신원과 기사 제목/요약어를 사용하는 로지스틱 회귀 모델; 공유된 트윗 행동을 기반으로 사용자를 군집화하는 토픽 모델링 변형; 그래프 기반의 공동체 기반 방법으로, 그래프의 조화 평균 함수에 영감을 받았다.
  • 기준 진실성은 두 개의 독립된 저질 뉴스 사이트 목록을 사용하여 확립되었다: Opensources(2017)와 Metacert로, 각각 약 500개의 사이트를 포함한다.
  • 성능 평가는 약 140만 건의 뉴스 항목과 2000만 건의 트윗으로 구성된 시간대 별 슬라이스를 기반으로 평가되었으며, 가짜 뉴스의 재현율과 주류 출처에서의 거짓 경고 비율에 초점을 맞췄다.
  • 시스템은 진실 가치 프로젝트의 일부로 구현되었으며, 공개 API, 트위터 봇(hoaxbot), 브라우저 북마크릿을 통해 실시간 신뢰도 점수를 제공한다.
  • 조화 공동체 기반 방법은 점진적 학습을 지원하여 새로운 데이터가 도착함에 따라 동적으로 업데이트가 가능하도록 했다.

실험 결과

연구 질문

  • RQ1트위터에서 공유되는 뉴스의 전반적인 스펙트럼에 대해 적용했을 때, 신뢰도 시스템은 가짜 또는 오락성 뉴스 탐지에 얼마나 효과적인가?
  • RQ2이러한 시스템의 주류 뉴스 출처에서의 거짓 경고 비율은 얼마이며, 수용 가능한 수준으로 유지되는가?
  • RQ3기존에 알려진 저질 사이트에서부터 다른 의심스럽거나 이전에 알려지지 않은 사이트를 식별하는 데 신뢰도 시스템이 일반화될 수 있는가?
  • RQ4사용자 기반, 콘텐츠 기반, 그래프 기반의 서로 다른 알고리즘 접근 방식 간의 성능 및 확장성은 어떻게 비교되는가?

주요 결과

  • 사용자 신원과 기사 본문 특징을 모두 사용하는 로지스틱 회귀 모델은 10건 이상의 트윗을 받은 가짜 뉴스에 대해 85% 이상의 재현율을 달성했으며, 주류 뉴스 출처에서 거짓 경고 비율은 1% 이하로 유지되었다.
  • 오직 사용자 신원에 의존하는 알고리즘은 사용자 및 콘텐츠 특징을 모두 사용하는 것과 거의 유사한 성능을 보였지만, 한 번만 공유된 URL의 경우 콘텐츠 특징이 상당한 성능 향상을 제공했다.
  • 조화 공동체 기반 방법은 뛰어난 일반화 능력을 보였으며, 두 개의 독립된 기준 진실성 목록 중 어느 쪽으로든 훈련을 시켰을 때 분류 결과에 미미한 차이가 있었고, 이는 다양한 훈련 데이터에 대해 강건함을 시사한다.
  • 거짓 경고 분석 과정에서 시스템은 인간의 사실 확인가들이 이전에 알지 못했던 수많은 저질 뉴스 사이트를 성공적으로 식별했으며, 이는 사전에 탐지 가능한 도구로서의 유용성을 시사한다.
  • 사이트 탐지 성능은 뛰어났으며, 최소 20개의 URL이 데이터셋에 포함된 다른 기준 진실성 목록의 사이트 중 80% 이상이 전체 훈련 세트를 사용할 경우 가짜 또는 오락성으로 정확히 식별되었다.
  • 조화 방법은 효과적이지만, 전체 그래프의 연결 구조에 의존하기 때문에 보다 광범위한 튜닝이 필요했으며, 이로 인해 소규모 실험은 어려웠다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.