Skip to main content
QUICK REVIEW

[논문 리뷰] Two Tales of the World: Comparison of Widely Used World News Datasets GDELT and EventRegistry

Haewoon Kwak, Jisun An|arXiv (Cornell University)|2016. 03. 07.
Data Management and Algorithms인용 수 12
한 줄 요약

이 논문은 규모, 뉴스 소스, 뉴스 지리학 측면에서 세계 주요 뉴스 데이터셋인 GDELT와 EventRegistry를 비교한다. GDELT는 EventRegistry 대비 기사 수와 소스 다양성에서 뚜렷한 차이를 보이지만(기사 수는 2.26배에서 6.43배 많고, 언어 수는 64.1개 대비 14개), 국적 언급 수로 측정한 뉴스 지리학은 높은 상관관계(스피어만의 ρ = 0.867)를 보이며, 이는 기반 데이터의 상이함에도 불구하고 일관된 세계 뉴스 커버리지 패턴을 반영한다.

ABSTRACT

In this work, we compare GDELT and Event Registry, which monitor news articles worldwide and provide big data to researchers regarding scale, news sources, and news geography. We found significant differences in scale and news sources, but surprisingly, we observed high similarity in news geography between the two datasets.

연구 동기 및 목표

  • GDELT와 EventRegistry라는 두 개의 널리 사용되는 세계 뉴스 데이터셋의 규모, 뉴스 소스 다양성, 지리적 커버리지 수준을 평가하고 비교하는 것.
  • 연구자들이 이 자료를 활용해 컴퓨팅 저널리즘 및 사회과학 연구를 수행할 때 발생할 수 있는 데이터셋 차이의 영향을 평가하는 것.
  • 다른 데이터 수집 방법이 국가 수준의 미디어 주목도 측면에서 세계 뉴스 표현 방식에 영향을 미치는지 조사하는 것.
  • 데이터의 기원과 한계를 이해하는 데 중점을 두어, 데이터셋 선택 및 활용에 대한 실증적 지침을 제공하는 것.

제안 방법

  • 시간적 변동성을 피하고 비교 가능성을 확보하기 위해 2015년 3월부터 12월까지 매달 첫 날을 표본으로 삼는다.
  • GDELT 데이터는 압축된 일일 덤프 파일(영어 및 다국어)을 통해 수집되며, EventRegistry 데이터는 공개 API를 통해 페이징 및 날짜 제한을 적용해 확보된다.
  • 뉴스 지리학은 각 국가의 언급 횟수를 세는 방식으로 정량화되며, GDELT의 경우 V2ENHANCEDLOCATIONS 필드를, EventRegistry의 경우 위치 메타데이터를 사용한다.
  • 뉴스 지리학의 유사성을 평가하기 위해 스피어만 순위 상관계수 분석을 사용하여, 국가 수준의 미디어 주목도의 유사성을 측정한다.
  • 소스 수준 분석은 두 플랫폼 간 고유 웹사이트 수, 언어 분포, 소스당 기사 수를 비교한다.
  • 기사 수 추세와 소스 특성 간의 관계를 평가하기 위해 피어슨 상관계수 및 스피어만의 ρ 검정을 적용한다.

실험 결과

연구 질문

  • RQ1GDELT와 EventRegistry의 규모와 소스 다양성은 동일한 기간 동안 어떻게 비교될 수 있는가?
  • RQ2두 데이터셋은 언어 커버리지와 언어별 기사 분포 측면에서 얼마나 다를까?
  • RQ3GDELT와 EventRegistry 간 뉴스 지리학—국가 수준의 기사 언급 수로 측정—은 얼마나 유사한가?
  • RQ4뉴스 소스의 웹 트래픽과 각 데이터셋 내 기사 출력량 사이의 관계는 어떠한가?
  • RQ5두 플랫폼 간 기사 수의 시간적 패턴은 어떻게 다를지, 이러한 차이를 이끌어내는 요인은 무엇인가?

주요 결과

  • GDELT는 일일 기사 수가 EventRegistry 대비 2.26배에서 6.43배 많으며, 두 데이터셋의 일일 기사 수 간 피어슨 상관계수는 r = 0.57 (p = 0.08)이다.
  • GDELT는 평균 일일 64.1개 언어를 커버하지만, EventRegistry는 오직 14개 언어만 포함한다. 다만 상위 10개 언어는 두 데이터셋 모두 유사한 편이다.
  • 소스 선택 방식의 차이에도 불구하고, 두 데이터셋의 뉴스 지리학은 높은 상관관계(스피어만의 ρ = 0.867, p = 1.896e-74)를 보이며, 이는 일관된 세계적 미디어 주목도 패턴을 반영한다.
  • 두 데이터셋의 상위 10% 뉴스 소스가 전체 기사의 약 80%를 차지하지만, 소스의 웹 트래픽과 기사 출력량 간 유의미한 상관관계는 없음(ρ = 0.17, p = 0.10).
  • GDELT는 방송, 인쇄, 오프라인 소스를 수집한다고 주장하지만, 기사의 99.9%는 웹에서 유래하며, 비워크 기반 소스는 0.1%에 불과하며 주로 BBC 모니터링에서 유래한다.
  • 두 데이터셋은 GDELT 소스 63,268개 중 13,867개, EventRegistry 소스 20,754개 중 13,867개를 공유하며, 웹 기반 뉴스에 집중하고 있음에도 불구하고 상호 간 겹침이 제한적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.