Skip to main content
QUICK REVIEW

[論文レビュー] Machine and Deep Learning Methods with Manual and Automatic Labelling for News Classification in Bangla Language

Istiak Ahmad, Fahad Alqurashi|arXiv (Cornell University)|Oct 19, 2022
Text and Document Classification Technologies被引用数 5
ひとこと要約

本稿では、664,880件の記事を含む新規に作成された大規模データセット(Potrika)を活用し、手動および自動ラベリングを組み合わせた機械学習およびディープラーニング手法を用いて、バングラ語ニュース分類を提案している。手動ラベリングではGRUとFastTextを用いて91.83%の精度を達成し、自動マルチラベル分類ではKNNとDoc2Vecを用いて75%の精度を達成した。これにより、バングラ語のような低リソース言語に対してもスケーラブルなNLPの実現可能性が示された。

ABSTRACT

Research in Natural Language Processing (NLP) has increasingly become important due to applications such as text classification, text mining, sentiment analysis, POS tagging, named entity recognition, textual entailment, and many others. This paper introduces several machine and deep learning methods with manual and automatic labelling for news classification in the Bangla language. We implemented several machine (ML) and deep learning (DL) algorithms. The ML algorithms are Logistic Regression (LR), Stochastic Gradient Descent (SGD), Support Vector Machine (SVM), Random Forest (RF), and K-Nearest Neighbour (KNN), used with Bag of Words (BoW), Term Frequency-Inverse Document Frequency (TF-IDF), and Doc2Vec embedding models. The DL algorithms are Long Short-Term Memory (LSTM), Bidirectional LSTM (BiLSTM), Gated Recurrent Unit (GRU), and Convolutional Neural Network (CNN), used with Word2vec, Glove, and FastText word embedding models. We develop automatic labelling methods using Latent Dirichlet Allocation (LDA) and investigate the performance of single-label and multi-label article classification methods. To investigate performance, we developed from scratch Potrika, the largest and the most extensive dataset for news classification in the Bangla language, comprising 185.51 million words and 12.57 million sentences contained in 664,880 news articles in eight distinct categories, curated from six popular online news portals in Bangladesh for the period 2014-2020. GRU and Fasttext with 91.83% achieve the highest accuracy for manually-labelled data. For the automatic labelling case, KNN and Doc2Vec at 57.72% and 75% achieve the highest accuracy for single-label and multi-label data, respectively. The methods developed in this paper are expected to advance research in Bangla and other languages.

研究の動機と目的

  • バングラ語ニュース分類を支援する包括的で大規模なデータセットの構築を目的とする。
  • 多様な機械学習およびディープラーニングモデルと、複数の単語埋め込み技術を用いたバングラ語テキスト分類における性能評価を目的とする。
  • 手動アノテーションへの依存を低減するため、トピックモデリング(LDA)を用いた自動ラベリング技術の検討を目的とする。
  • 最先端の評価指標を用いて、シングルラベル分類とマルチラベル分類の性能を比較することを目的とする。
  • 手動および自動ラベリング戦略を統合することで、バングラ語NLPのベンチマークを確立することを目的とする。

提案手法

  • 2014年から2020年までの6つの主要なバングラ語ニュースポータルから収集した、664,880件の記事(185.51M語、12.57M文)を含む大規模なバングラ語ニュースデータセット「Potrika」を構築した。8つのカテゴリにラベル付けされた。
  • BoW、TF-IDF、Doc2Vec埋め込みを用いた、従来の機械学習モデル(ロジスティック回帰、SGD、SVM、ランダムフォレスト、KNN)を適用した。
  • 文脈的表現のため、Word2Vec、GloVe、FastTextの単語埋め込みを用いたLSTM、BiLSTM、GRU、CNNなどのディープラーニングモデルを実装した。
  • 未ラベルデータからトピックベースのラベルを生成するために、潜在ディリクレ割り当て(LDA)を用いた自動ラベリングを実装した。
  • 精度、再現率、F1スコア、ハミング損失を用いてシングルラベルおよびマルチラベル分類を評価し、マルチラベル互換性を確保するためのラベル変換を実施した。
  • マルチラベル予測のためのしきい値を0.3に設定し、元のシングルラベルの正解ラベルと比較した。

実験結果

リサーチクエスチョン

  • RQ1手動ラベル付きデータを用いたバングラ語ニュース分類において、どの機械学習およびディープラーニングモデルが最も高い精度を達成するか?
  • RQ2トピックモデリング(LDA)に基づく自動ラベリング技術は、手動ラベリングと比較して、バングラ語ニュース分類においてどの程度有効であるか?
  • RQ3BoW、TF-IDF、Doc2Vec、Word2Vec、GloVe、FastTextといった異なる単語埋め込み技術は、バングラ語分類性能にどのような影響を与えるか?
  • RQ4同じモデルと埋め込みを用いた場合、マルチラベル分類の性能はシングルラベル分類と比べてどのように異なるか?
  • RQ5ステミングの使用は、バングラ語テキスト分類モデルの性能に顕著な影響を及ぼすか?

主な発見

  • 手動ラベリングにおいて、GRUとFastText埋め込みを組み合わせたモデルが91.83%の最高精度を達成し、他のディープラーニングおよび機械学習モデルを上回った。
  • 自動マルチラベル分類において、KNNとDoc2Vecを組み合わせたモデルが、全評価手法の中で最高の75%の精度を達成した。
  • KNNはマルチラベル分類において、90%の精度、88%の再現率、87%のF1スコアを達成し、指標のバランスが優れていた。
  • ハミング損失は低く(マルチラベルで0.03、元のラベルで0.09)、マルチラベル設定における高品質なラベル予測を示した。
  • ディープラーニングモデルは、特にFastTextのような文脈的埋め込みを用いることで、機械学習モデルを常に上回った。
  • ステミングの使用はモデル性能に顕著な影響を及ぼさず、この文脈では語形の正規化がやや重要でないと示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。