[논문 리뷰] NELA-GT-2019: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles
이 논문은 2019년 1월부터 12월까지 260개의 출처에서 발표된 112만 건의 영어 뉴스 기사로 구성된 대규모 다중 레이블 뉴스 데이터셋인 NELA-GT-2019을 소개한다. 이 데이터셋은 Media Bias/Fact Check, AllSides, PolitiFact 등 7개 평가 사이트에서 제공하는 출처 수준의 진실성 레이블을 통합하며, 신뢰할 만한, 혼합, 신뢰할 수 없는 3단계의 집계된 신뢰성 레이블을 포함하고 있어, 오랫동안 잘못된 정보, 개념 이동, 위장 정보 전략에 대한 강력한 연구를 가능하게 한다.
In this paper, we present an updated version of the NELA-GT-2019 dataset, entitled NELA-GT-2020. NELA-GT-2020 contains nearly 1.8M news articles from 519 sources collected between January 1st, 2020 and December 31st, 2020. Just as with NELA-GT-2018 and NELA-GT-2019, these sources come from a wide range of mainstream news sources and alternative news sources. Included in the dataset are source-level ground truth labels from Media Bias/Fact Check (MBFC) covering multiple dimensions of veracity. Additionally, new in the 2020 dataset are the Tweets embedded in the collected news articles, adding an extra layer of information to the data. The NELA-GT-2020 dataset can be found at https://doi.org/10.7910/DVN/CHMUYZ.
연구 동기 및 목표
- 오늘날의 잘못된 정보 연구를 위해 대규모, 실시간, 다중 레이블 뉴스 데이터셋의 부족 문제를 해결하기 위해.
- NELA-GT-2018 데이터셋을 66개의 새로운 출처와 400만 건의 추가 기사로 12개월 동안 수집하여 확장하기 위해.
- 데이터셋 확장에도 불구하고 출처 간 고밀도 레이블을 유지하여 모델 훈련 및 분석을 위한 신뢰할 수 있는 기초 데이터를 확보하기 위해.
- 더 넓은 연구 활용성을 위해 최신 공개 가능한 데이터 포맷(SQLite 및 JSON)과 추출 스크립트를 제공하기 위해.
- 뉴스 미디어에서의 개념 이동, 준지도 학습, 진화하는 위장 정보 전략에 대한 장기 연구를 지원하기 위해.
제안 방법
- Python 라이브러리인 feedparser와 goose를 사용해 매일 2회 260개의 뉴스 출처에서 RSS 피드를 자동으로 크롤링하여 데이터셋을 수집하였다.
- Media Bias/Fact Check(MBFC), AllSides, PolitiFact 등을 포함한 7개의 외부 평가 사이트에서 제공하는 출처 수준의 레이블을 집계하였으며, 정치적 성향, 사실 기반 보도, 편향성 등을 포함한다.
- MBFC의 출처 유형 및 사실 기반 보도 점수를 기반으로 새로운 3단계 집계된 신뢰성 레이블을 생성하였다: 신뢰할 수 없는(음모론/가짜 과학 또는 매우 낮은 사실성), 혼합(혼합된 사실성), 신뢰할 만한(높거나 매우 높은 사실성).
- 데이터셋은 두 가지 형식으로 배포되었으며, 구조화된 SQLite 데이터베이스와 각 뉴스 출처별로 JSON 사전 형식을 제공하여 유연한 데이터 접근성을 확보하였다.
- 두 형식에서 데이터를 추출할 수 있는 Python 스크립트를 개발하여 연구자의 재현성과 활용도를 향상시켰다.
- 데이터 수집 과정을 안정화하여 일관된 12개월 커버리지를 확보하였으며, NELA-GT-2018의 10개월 범위를 초월하였다.
실험 결과
연구 질문
- RQ1개념 이동의 영향으로 인해 뉴스 기사의 진실성 검출 성능이 시간에 따라 어떻게 변화하는가? 이는 장기적이고 일관된 데이터를 통해 연구할 수 있는가?
- RQ2대규모 뉴스 데이터셋 내에서 레이블이 없는 기사나 혼합된 진실성 레이블을 가진 출처들이 준지도 학습 프레임워크에서 잘못된 정보 탐지에 효과적으로 활용될 수 있는가?
- RQ3다양한 정치적 사건과 시간대에 따라 위장 정보 전략과 출처 행동은 어떻게 변화하는가?
- RQ412개월 동안 주요 뉴스 사건 동안 정치적 서사와 출처의 신뢰성 분류는 어떻게 변화하는가?
- RQ5단일 레이블 접근 방식에 비해 집계된 출처 수준의 레이블이 잘못된 정보 탐지 모델의 강건성에 얼마나 기여하는가?
주요 결과
- NELA-GT-2019는 2019년 1월부터 12월까지 12개월 동안 수집된 112만 건의 뉴스 기사와 260개의 출처를 포함하며, NELA-GT-2018 대비 40만 건의 기사 증가를 기록하였다.
- 데이터셋의 79%의 출처가 7개 평가 사이트 중 최소 한 곳에서 레이블을 확보하였으며, 76%는 Media Bias/Fact Check(MBFC) 레이블을 확보하여 확장에도 불구하고 고밀도 레이블 유지가 이루어졌다.
- MBFC의 출처 유형 및 사실 기반 보도 점수를 기반으로 유도된 새로운 3단계 집계된 신뢰성 레이블을 포함하여, 출처 신뢰성에 대한 더 세분화된 분석이 가능해졌다.
- NewsGuard의 이용 약관 변경 및 요금제 모델 변화로 인해 레이블이 제외되었으며, 이제는 7개의 대체 평가 자료에 의존하고 있다.
- SQLite 및 JSON이라는 현대적인 두 가지 형식으로 제공되며, 데이터 추출을 위한 즉시 사용 가능한 Python 스크립트가 함께 제공되어 접근성과 재현성이 향상되었다.
- NELA-GT-2018 및 NELA-2017와의 조합을 통해 2.5년에 걸친 일관된 뉴스 데이터셋을 구성할 수 있어, 잘못된 정보 및 미디어 신뢰성의 시간적 역학을 연구하는 데에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.