Skip to main content
QUICK REVIEW

[논문 리뷰] NELA-GT-2022: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles

Maurício Gruppi, Benjamin D. Horne|arXiv (Cornell University)|2022. 03. 10.
Misinformation and Its Impacts인용 수 5
한 줄 요약

NELA-GT-2022는 2022년 1월 1일부터 12월 31일까지 361개의 출판사에서 올라온 1,778,361건의 영문 뉴스 기사로 구성된 대규모 다중라벨 뉴스 데이터셋이다. Media Bias/Fact Check에서 제공하는 출판사 수준의 진실성 레이블과 임bedded 트윗 데이터를 포함하여, 높은 시간적 커버리지와 일관성을 바탕으로 잘못된 정보, 미디어 편향, 사건 기반 미디어 서사에 대한 연구를 가능하게 한다.

ABSTRACT

In this paper, we present the fifth installment of the NELA-GT datasets, NELA-GT-2022. The dataset contains 1,778,361 articles from 361 outlets between January 1st, 2022 and December 31st, 2022. Just as in past releases of the dataset, NELA-GT-2022 includes outlet-level veracity labels from Media Bias/Fact Check and tweets embedded in collected news articles. The NELA-GT-2022 dataset can be found at: https://doi.org/10.7910/DVN/AMCV2H

연구 동기 및 목표

  • 다양한 출판사들에서 잘못된 정보와 미디어 진실성에 대한 종합적이고 최신이며 일관성 있는 뉴스 데이터셋을 제공하기 위해.
  • 미디어 행동과 사건 기반 서사에 대한 종단적 연구를 위해 높은 시간적 커버리지와 데이터 완전성을 유지하기 위해.
  • 특히 하이브리드 미디어 시스템에서 정치적 커뮤니케이션 연구를 지원하기 위해 뉴스 기사에 임bedded 트윗을 포함하기 위해.
  • 일관된 다년간의 데이터 수집을 통해 자동화된 잘못된 정보 탐지 모델의 강력한 평가를 가능하게 하기 위해.
  • 루소-우크라이나 전쟁과 로 에이드 판결 뒤 뒤집힘과 같은 2022년 주요 사건들에 대해 이벤트 기반 서브셋을 제공하여 집중 분석을 가능하게 하기 위해.

제안 방법

  • Python 라이브러리인 feedparser와 Goose3를 사용해 매일 두 번씩 RSS 피드 스크래핑을 통해 뉴스 기사를 수집하여, 데이터셋에 포함된 모든 출판사에 대해 거의 완전한 커버리지 확보.
  • Media Bias/Fact Check(MBFC)를 사용해 진실성 레이블을 할당하였으며, 361개 출판사 중 337개가 레이블링되어 출판사 신뢰성에 대한 다중 클래스 분석이 가능해짐.
  • 기사 페이지에서 Goose3를 사용해 임bedded 트윗을 추출하였으며, 트윗 ID와 텍스트를 기사 메타데이터와 함께 구조화된 데이터베이스에 저장.
  • NLP 및 텍스트 분석에 유용성을 유지하면서 뉴스 소비를 방지하기 위해 토큰의 7%를 '@'으로 대체하여 텍스트를 은폐 처리함.
  • 데이터셋은 SQLite 데이터베이스와 각 뉴스 출판사별 JSON 사전 형식으로 배포되었으며, 액세스 및 파싱을 위한 공개 코드가 제공됨.
  • 루소-우크라이나 전쟁과 로 에이드 판결 뒤 뒤집힘에 대해 关련 키워드 매칭을 사용해 이벤트 기반 서브셋을 생성하여 주요 사건의 미디어 보도에 대한 집중 연구를 가능하게 함.

실험 결과

연구 질문

  • RQ1루소-우크라이나 전쟁과 로 에이드 판결 뒤 뒤집힘과 같은 주요 지정학적·정치적 사건들에 대한 뉴스 보도가 진실성 수준이 다른 출판사들 사이에서 어떻게 다를까?
  • RQ2낮은 진실성 수준의 뉴스 출판사들이 높은 영향력을 가진 사건들에 대해 어떤 방식으로 서사를 확대하거나 왜곡하는가? 이를 임bedded 트윗과 기사 내용을 통해 어떻게 입증할 수 있는가?
  • RQ3전체 연도 동안 데이터 수집 과정은 얼마나 안정적이고 일관성 있는가? 기사 및 트윗 커버리지의 실제 완전성은 어떠한가?
  • RQ4자동화된 잘못된 정보 탐지 모델의 장기적 평가를 위해 이 데이터셋은 시간, 사건, 혼합된 진실성 레이블을 고려한 강력한 평가를 지원할 수 있는가?
  • RQ5뉴스 기사에 포함된 임bedded 트윗은 하이브리드 미디어 환경에서 정치적 서사의 확산에 어떻게 기여하는가?

주요 결과

  • 361개의 출판사에서 온 총 1,778,361건의 뉴스 기사가 포함되어 있으며, Media Bias/Fact Check에서 337개 출판사에 진실성 레이블이 할당되어 신뢰할 수 있는 출판사 수준의 분류가 가능하다.
  • 기사에 포함된 총 346,283개의 고유한 트윗이 존재하여, 소셜 미디어 통합을 통한 정치적 논의와 미디어 조작 분석이 가능하다.
  • 2022년 전체 기간 동안 기사 수집 과정이 거의 완전한 커버리지로 이루어졌으며, 주간 기사 및 트윗 수를 통해 결측 데이터가 최소한으로 발생한 것으로 확인되었다.
  • 루소-우크라이나 전쟁과 로 에이드 판결 뒤 뒤집힘에 대해 키워드 매칭을 사용해 성공적으로 이벤트 기반 서브셋을 생성하였으며, 주요 사건 기간 동안 커버리지가 최고조에 이르렀다.
  • 전체 NELA-GT 컬렉션은 5.5년 동안 약 610만 건 이상의 기사로 구성되어 있어 종단적 연구를 위한 일관성 있는 분석이 가능하며, 다수의 연도에 걸쳐 분석이 가능하다.
  • 텍스트 은폐 처리를 통해 분석을 위해 약 93%의 원본 콘텐츠를 유지하면서도 뉴스 소비를 방지하여 윤리적 데이터 사용 기준을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.