Skip to main content
QUICK REVIEW

[논문 리뷰] Potrika: Raw and Balanced Newspaper Datasets in the Bangla Language with Eight Topics and Five Attributes

Istiak Ahmad, Fahad Alqurashi|arXiv (Cornell University)|2022. 10. 17.
Imbalanced Data Classification Techniques인용 수 6
한 줄 요약

이 논문은 현재까지 가장 크고 종합적인 단일 레이블 방글라 뉴스 데이터셋인 Potrika를 소개한다. 이 데이터셋은 8개 주제와 5개 속성에 걸쳐 총 664,880개의 원본 기사(18551만 단어, 1257만 문장)를 포함한다. 배경 번역과 NLP 증강 기법을 활용해, 각 카테고리당 4만 개씩 총 32만 개의 균형 잡힌 기사로 구성된 데이터셋을 만들었으며, 이는 방글라 텍스트 분류, 요약, 생성 분야의 강력한 NLP 연구를 가능하게 한다.

ABSTRACT

Knowledge is central to human and scientific developments. Natural Language Processing (NLP) allows automated analysis and creation of knowledge. Data is a crucial NLP and machine learning ingredient. The scarcity of open datasets is a well-known problem in machine and deep learning research. This is very much the case for textual NLP datasets in English and other major world languages. For the Bangla language, the situation is even more challenging and the number of large datasets for NLP research is practically nil. We hereby present Potrika, a large single-label Bangla news article textual dataset curated for NLP research from six popular online news portals in Bangladesh (Jugantor, Jaijaidin, Ittefaq, Kaler Kontho, Inqilab, and Somoyer Alo) for the period 2014-2020. The articles are classified into eight distinct categories (National, Sports, International, Entertainment, Economy, Education, Politics, and Science \& Technology) providing five attributes (News Article, Category, Headline, Publication Date, and Newspaper Source). The raw dataset contains 185.51 million words and 12.57 million sentences contained in 664,880 news articles. Moreover, using NLP augmentation techniques, we create from the raw (unbalanced) dataset another (balanced) dataset comprising 320,000 news articles with 40,000 articles in each of the eight news categories. Potrika contains both the datasets (raw and balanced) to suit a wide range of NLP research. By far, to the best of our knowledge, Potrika is the largest and the most extensive dataset for news classification.

연구 동기 및 목표

  • 뉴스 분류를 위한 대규모 공개 데이터셋이 부족한 문제를 해결한다.
  • 기존의 방글라 뉴스 데이터셋에서 발생하는 불균형 문제를 NLP 증강 기법을 통해 해결한다.
  • 뉴스 기사, 카테고리, 제목, 발행 일자, 출처 등 5개 속성을 포함한 종합적이고 공개 가능한 데이터셋을 제공하여 다양한 NLP 응용 분야를 지원한다.
  • 기계 학습 및 딥 러닝 모델의 방글라 자연어 처리 성능 향상을 위한 기준 테스트 및 발전을 가능하게 한다.
  • 저자원 언어 환경에서의 시계열 분석, 关련어 트렌드 탐지 및 강력한 텍스트 분류를 지원한다.

제안 방법

  • 2014~2020년 동안 방글라데시 주요 온라인 뉴스 포털( Jugantor, Jaijaidin, Ittefaq, Kaler Kontho, Inqilab, Somoyer Alo)에서 원본 뉴스 기사를 수집했다.
  • 기사들을 국적, 스포츠, 국제, 엔터테인먼트, 경제, 교육, 정치, 과학 및 기술의 8개 주제로 분류했다.
  • 기사당 5개 속성(전체 뉴스 텍스트, 카테고리, 제목, 발행 일자, 신문사 출처)을 추출했다.
  • 부족한 카테고리(교육, 경제, 과학 및 기술, 정치, 엔터테인먼트)의 균형을 맞추기 위해 Google 번역 API(5000자 제한)를 활용한 역번역 기법을 적용했다.
  • 동의어 교체, 무작위 삽입, 삭제, 텍스트 교환(EDA) 및 NLP Albumentation(셔플링/중복 제거)을 사용해 데이터 균형을 향상시켰다.
  • 다국어 역번역을 통해 의미적 맥락을 유지하면서도, 카테고리당 정확히 4만 개씩 총 32만 개의 균형 잡힌 기사로 구성된 데이터셋을 확보했다.

실험 결과

연구 질문

  • RQ1저자원 언어 환경에서 강력한 NLP 연구를 지원하기 위해 대규모 균형 잡힌 방글라 뉴스 데이터셋을 어떻게 구성할 수 있는가?
  • RQ2역번역 및 EDA 기법이 방글라 뉴스 텍스트 데이터셋의 불균형 문제를 얼마나 효과적으로 해결할 수 있는가?
  • RQ3단일 레이블 다중 카테고리 방글라 뉴스 데이터셋이 텍스트 분류, 요약, 생성과 같은 다양한 NLP 작업을 지원할 수 있는가?
  • RQ4발행 일자와 같은 시계열 메타데이터가 뉴스 트렌드와 주제의 진화를 장기적으로 분석하는 데 어떤 영향을 미치는가?
  • RQ5데이터셋의 크기와 균형이 방글라 텍스트 분류에서 기계 학습 모델의 성능에 어떤 영향을 미치는가?

주요 결과

  • Potrika는 총 664,880개의 원본 뉴스 기사(1억 8,551만 단어, 1,257만 문장)를 포함하며, 현재까지 가장 큰 방글라 뉴스 데이터셋이다.
  • 원본 데이터셋은 8개의 고유한 카테고리로 구성되어 있으며, 국적, 국제, 스포츠 카테고리가 각각 10만 개 이상의 기사로 가장 빈도가 높다.
  • 역번역과 NLP 증강 기법을 통해 카테고리당 정확히 4만 개씩 총 32만 개의 균형 잡힌 기사로 구성된 데이터셋을 구축했다.
  • 균형 잡힌 데이터셋은 모든 카테고리에 대해 동일한 표현 비율을 보장하여 후속 NLP 모델의 편향을 줄인다.
  • 기사당 5개의 속성을 포함하여 콘텐츠, 맥락, 시계열 트렌드에 대한 풍부한 분석이 가능하다.
  • Potrika는 공개적으로 이용 가능하며, 방글라 NLP 분야의 텍스트 분류, 요약, 생성 분야의 기준 데이터셋으로 설계되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.