Skip to main content
QUICK REVIEW

[論文レビュー] Potrika: Raw and Balanced Newspaper Datasets in the Bangla Language with Eight Topics and Five Attributes

Istiak Ahmad, Fahad Alqurashi|arXiv (Cornell University)|Oct 17, 2022
Imbalanced Data Classification Techniques被引用数 6
ひとこと要約

本論文は、8つのトピックと5つの属性をカバーする、これまでで最大かつ最も包括的な単一ラベル・バングラニュースデータセットであるPotrikaを紹介する。全664,880件の原文記事(185.51百万語、12.57百万文)を含み、バックトランスレーションおよびNLP拡張を用いて、分類ごとに40,000件ずつ合計320,000件のバランスの取れたデータセットを構築した。これにより、バングラ語のテキスト分類、要約、生成に関する強固なNLP研究が可能となる。

ABSTRACT

Knowledge is central to human and scientific developments. Natural Language Processing (NLP) allows automated analysis and creation of knowledge. Data is a crucial NLP and machine learning ingredient. The scarcity of open datasets is a well-known problem in machine and deep learning research. This is very much the case for textual NLP datasets in English and other major world languages. For the Bangla language, the situation is even more challenging and the number of large datasets for NLP research is practically nil. We hereby present Potrika, a large single-label Bangla news article textual dataset curated for NLP research from six popular online news portals in Bangladesh (Jugantor, Jaijaidin, Ittefaq, Kaler Kontho, Inqilab, and Somoyer Alo) for the period 2014-2020. The articles are classified into eight distinct categories (National, Sports, International, Entertainment, Economy, Education, Politics, and Science \& Technology) providing five attributes (News Article, Category, Headline, Publication Date, and Newspaper Source). The raw dataset contains 185.51 million words and 12.57 million sentences contained in 664,880 news articles. Moreover, using NLP augmentation techniques, we create from the raw (unbalanced) dataset another (balanced) dataset comprising 320,000 news articles with 40,000 articles in each of the eight news categories. Potrika contains both the datasets (raw and balanced) to suit a wide range of NLP research. By far, to the best of our knowledge, Potrika is the largest and the most extensive dataset for news classification.

研究の動機と目的

  • ニュース分類を対象とする、大規模かつ公開可能なバングラ語NLPデータセットの著しい不足に対処すること。
  • NLP拡張技術を用いて、既存のバングラ語ニュースデータセットにおける不均衡を是正すること。
  • 多様なNLP応用を可能にするために、5つの属性(ニュース記事、カテゴリ、見出し、発行日、出典)を備えた包括的かつ公開可能なデータセットを提供すること。
  • バングラ語自然言語処理における機械学習およびディープラーニングモデルのベンチマーク化と発展を可能にすること。
  • 低リソース言語環境下での時系列的分析、キーワードトレンド検出、および強固なテキスト分類を支援すること。

提案手法

  • 2014年から2020年までに、6つの主要なバングラデシュのオンラインニュースポータル(Jugantor, Jaijaidin, Ittefaq, Kaler Kontho, Inqilab, Somoyer Alo)から原文ニュース記事を収集した。
  • 記事を8つの明確なカテゴリに分類した:National, Sports, International, Entertainment, Economy, Education, Politics, Science & Technology。
  • 各記事から5つの属性を抽出した:完全なニュース本文、カテゴリ、見出し、発行日、新聞出典。
  • 不足しているカテゴリ(Education, Economy, Science & Technology, Politics, Entertainment)の拡張のために、Google Translate API(5000文字制限)を用いたバックトランスレーションを適用した。
  • 語彙置換、ランダム挿入、削除、テキスト入れ替え(EDA)およびNLP Albumentation(シャッフル/重複削除)を用いて、データのバランスを向上させた。
  • 多言語バックトランスレーションにより意味的文脈を保持しつつ、8カテゴリにそれぞれ40,000件ずつ合計320,000件のバランスの取れたデータセットを達成した。

実験結果

リサーチクエスチョン

  • RQ1低リソース言語における強固なNLP研究を支援するため、大規模かつバランスの取れたバングラ語ニュースデータセットをどのように構築できるか?
  • RQ2バックトランスレーションおよびEDA技術は、バングラ語の不均衡なニューステキストデータセットをどれほど効果的にバランスさせるか?
  • RQ3単一ラベルで多様なカテゴリを含むバングラ語ニュースデータセットは、テキスト分類、要約、生成といった多様なNLPタスクをサポートできるか?
  • RQ4発行日という時系列メタデータを含めることで、ニューストレンドやトピックの進化に関する縦断的分析がどのように可能になるか?
  • RQ5データセットのサイズとバランスは、バングラ語テキスト分類における機械学習モデルの性能にどのような影響を及えるか?

主な発見

  • Potrikaは、185.51百万語、12.57百万文を含む664,880件の原文ニュース記事を含み、これまでで最大のバングラ語ニュースデータセットである。
  • 原文データセットは8つの明確なカテゴリをカバーしており、National, International, Sportsが最も頻度が高い(各100,000件以上)。
  • バックトランスレーションおよびNLP拡張を用いて、320,000件のバランスの取れたデータセットを構築した(カテゴリ別に40,000件)。
  • バランスの取れたデータセットにより、すべてのカテゴリが均等に表現され、下流のNLPモデルにおけるバイアスが低減された。
  • 各記事に5つの属性が含まれており、コンテンツ、文脈、時系列的トレンドの豊富な分析が可能である。
  • Potrikaは公開可能であり、バングラ語NLPにおけるテキスト分類、要約、生成のベンチマークとして設計されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。