Skip to main content
QUICK REVIEW

[논문 리뷰] Embedded HuffPost New Category Dataset

Rishabh Misra, Misra, Rishabh|arXiv (Cornell University)|2022. 09. 23.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 2012년에서 2022년까지의 210,294개의 HuffPost 뉴스 헤드라인을 포함하는 대규모 고품질 뉴스 카테고리 데이터셋을 소개한다. 이 데이터셋은 세분화된 카테고리 레이블, 게재 일자, 메타데이터를 포함하며, 의미적 태깅, 풍자 탐지, 편향 분석 등의 NLP 연구를 가능하게 한다. 또한 BERT 기반 모델을 활용한 전염병학적 텍스트 분류 및 미디어 언어 분석과 같은 작업에 널리 활용되고 있다.

ABSTRACT

People rely on news to know what is happening around the world and inform their daily lives. In today's world, when the proliferation of fake news is rampant, having a large-scale and high-quality source of authentic news articles with the published category information is valuable to learning authentic news' Natural Language syntax and semantics. As part of this work, we present a News Category Dataset that contains around 210k news headlines from the year 2012 to 2022 obtained from HuffPost, along with useful metadata to enable various NLP tasks. In this paper, we also produce some novel insights from the dataset and describe various existing and potential applications of our dataset.

연구 동기 및 목표

  • NLP 연구를 위한 세분화된 카테고리 레이블과 메타데이터를 갖춘 대규모 고품질 뉴스 데이터셋을 구축하기 위해.
  • 언론의 추세와 미디어의 주요 관심사 변화를 시간에 따라 분석할 수 있도록 하기 위해.
  • 의미적 태깅, 명명된 실체 인식, 어휘의 의미 다의성 해소와 같은 자연어 처리 작업을 지원하기 위해.
  • 다양한 뉴스 카테고리 간 언어 패턴과 의미적 구조를 연구하기 위한 기준을 제공하기 위해.
  • 성별 표현과 경찰 살해 사건 보도에서의 언어 사용을 포함한 미디어 편향 연구를 촉진하기 위해.

제안 방법

  • 웹 스크래핑을 위해 BeautifulSoup와 Selenium를 사용하여 HuffPost의 아카이브 웹 페이지에서 뉴스 헤드라인을 수집하였다.
  • 카테고리, 헤드라인, 저자, 게재 일자, 요약 개요, 기사 링크 등의 구조화된 메타데이터를 추출하였다.
  • 데이터 품질과 일관성을 확보하기 위해 1,000건 미만의 기사가 포함된 카테고리는 필터링하였다.
  • 진정한 뉴스와 TheOnion에서 수집한 풍자 헤드라인을 결합하여 주의 메커니즘을 갖춘 하이브리드 신경망을 사용해 풍자 탐지 모델을 개발하였다.
  • 범죄 관련 뉴스에서의 미디어 언어 패턴을 식별하기 위해 BERT 기반 모델을 적용하였으며, 특히 수동태와 명사화를 중심으로 분석하였다.
  • 전염병 관련 콘텐츠와 필터링된 비전염병 관련 뉴스를 수직 통합하여 전염병학적 텍스트 분류를 위한 데이터셋을 구축하였다.

실험 결과

연구 질문

  • RQ1어휘 선택과 문법적 구조와 같은 언어적 특징이 뉴스 카테고리 간에 어떻게 다를까?
  • RQ2뉴스 카테고리 메타데이터는 풍자 탐지 및 의미적 태깅과 같은 NLP 작업에서 모델 성능을 얼마나 향상시킬 수 있을까?
  • RQ32012년에서 2022년 사이에 뉴스의 주요 관심사가 카테고리 간에 어떻게 변화해 왔는가?
  • RQ4언론은 경찰 살해 사건 보도에서 책임을 모호하게 만들기 위해 어떤 언어적 구조를 사용하는가?
  • RQ5다양한 카테고리에서 뉴스 헤드라인과 초록에 암시적·명시적 성별 편향이 어떻게 나타나는가?

주요 결과

  • 이 데이터셋은 42개의 카테고리에 걸쳐 총 210,294개의 뉴스 헤드라인을 포함하고 있으며, 정치(35,602건)와 웰빙(17,945건) 카테고리가 가장 빈도가 높다.
  • 데이터 품질을 확보하기 위해 1,000건 미만의 기사가 포함된 카테고리는 제거되었으며, 이로 인해 고카버리지 주제에 집중된 정제된 데이터셋이 만들어졌다.
  • 이 데이터셋과 TheOnion을 통합하여 생성한 뉴스 헤드라인 풍자 탐지 데이터셋은 트위터 기반 풍자 데이터셋보다 낮은 레이블 노이즈와 높은 레이블 밀도를 보였다.
  • BERT 기반 분석 결과, 경찰 살해 사건 보도는 민간인 살해 사건 보다 더 많은 수동태, 명사화, 불타동사 사용을 보였으며, 이는 책임을 은폐할 수 있는 가능성을 시사한다.
  • 성별 표현 분석을 통해 다양한 뉴스 카테고리에서 어휘 선택, 콘텐츠 구성, 레이블링 방식에 사회적으로 구성된 편향이 뚜렷하게 드러났다.
  • 이 데이터셋을 활용해 전염병 관련 콘텐츠를 필터링하고 관련 뉴스와 통합함으로써 고품질의 전염병학적 텍스트 분류 데이터셋을 구축하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.