Skip to main content
QUICK REVIEW

[논문 리뷰] Machine and Deep Learning Methods with Manual and Automatic Labelling for News Classification in Bangla Language

Istiak Ahmad, Fahad Alqurashi|arXiv (Cornell University)|2022. 10. 19.
Text and Document Classification Technologies인용 수 5
한 줄 요약

이 논문은 수작업 및 자동 레이블링을 활용하여 664,880편의 기사가 포함된 새로 제작된 대규모 데이터셋(Potrika)을 기반으로 방글라 뉴스 분류를 위한 머신러닝 및 딥러닝 방법을 제안한다. 수작업 레이블링에서는 GRU와 FastText를 사용해 91.83%의 정확도를 달성하였고, 자동 다중레이블 분류에서는 KNN과 Doc2Vec를 사용해 75%의 정확도를 기록하여 방글라와 같은 저자원 언어에 대한 확장 가능한 NLP의 가능성을 입증한다.

ABSTRACT

Research in Natural Language Processing (NLP) has increasingly become important due to applications such as text classification, text mining, sentiment analysis, POS tagging, named entity recognition, textual entailment, and many others. This paper introduces several machine and deep learning methods with manual and automatic labelling for news classification in the Bangla language. We implemented several machine (ML) and deep learning (DL) algorithms. The ML algorithms are Logistic Regression (LR), Stochastic Gradient Descent (SGD), Support Vector Machine (SVM), Random Forest (RF), and K-Nearest Neighbour (KNN), used with Bag of Words (BoW), Term Frequency-Inverse Document Frequency (TF-IDF), and Doc2Vec embedding models. The DL algorithms are Long Short-Term Memory (LSTM), Bidirectional LSTM (BiLSTM), Gated Recurrent Unit (GRU), and Convolutional Neural Network (CNN), used with Word2vec, Glove, and FastText word embedding models. We develop automatic labelling methods using Latent Dirichlet Allocation (LDA) and investigate the performance of single-label and multi-label article classification methods. To investigate performance, we developed from scratch Potrika, the largest and the most extensive dataset for news classification in the Bangla language, comprising 185.51 million words and 12.57 million sentences contained in 664,880 news articles in eight distinct categories, curated from six popular online news portals in Bangladesh for the period 2014-2020. GRU and Fasttext with 91.83% achieve the highest accuracy for manually-labelled data. For the automatic labelling case, KNN and Doc2Vec at 57.72% and 75% achieve the highest accuracy for single-label and multi-label data, respectively. The methods developed in this paper are expected to advance research in Bangla and other languages.

연구 동기 및 목표

  • 방글라 뉴스 분류를 위한 종합적이고 대규모의 데이터셋을 구축하여 NLP 연구를 지원한다.
  • 다양한 머신러닝 및 딥러닝 모델과 여러 단어 임베딩 기법을 활용한 방글라 텍스트 분류 성능을 평가한다.
  • 수작업 레이블링에 대한 의존도를 줄이기 위해 주제 모델링(LDA) 기반 자동 레이블링 기법을 탐구한다.
  • 최신 평가 지표를 사용하여 단일레이블 및 다중레이블 분류 성능을 비교한다.
  • 수작업 및 자동 레이블링 전략을 융합하여 방글라 NLP의 기준 성능을 설정한다.

제안 방법

  • 2014~2020년 사이의 여섯 개 주요 방글라 뉴스 포털에서 수집한 664,880편의 기사(185.51M 단어, 12.57M 문장)를 기반으로, 8개 카테고리로 레이블링된 대규모 방글라 뉴스 데이터셋인 Potrika를 구축하였다.
  • 보편적인 머신러닝 모델(Logistic Regression, SGD, SVM, Random Forest, KNN)에 BoW, TF-IDF, Doc2Vec 임베딩을 적용하였다.
  • 문맥적 표현을 위해 Word2Vec, GloVe, FastText 단어 임베딩을 사용한 딥러닝 모델(LSTM, BiLSTM, GRU, CNN)을 구현하였다.
  • 수집된 데이터에서 주제 기반 레이블을 생성하기 위해 잠재적 디리히레트 분포(LDA)를 활용한 자동 레이블링을 구현하였다.
  • 정밀도, 재현도, F1 점수, 해밍 손실을 사용하여 단일레이블 및 다중레이블 분류를 평가하였으며, 다중레이블 호환성을 확보하기 위해 레이블 변환 기법을 적용하였다.
  • 다중레이블 예측에 대해 임계값 0.3를 설정하고, 원본 단일레이블 진짜값과 결과를 비교하였다.

실험 결과

연구 질문

  • RQ1수작업 레이블링 데이터를 사용한 방글라 뉴스 분류에서 어떤 머신러닝 및 딥러닝 모델이 가장 높은 정확도를 달성하는가?
  • RQ2주제 모델링(LDA) 기반 자동 레이블링 기법은 수작업 레이블링에 비해 방글라 뉴스 분류에서 얼마나 효과적인가?
  • RQ3BoW, TF-IDF, Doc2Vec, Word2Vec, GloVe, FastText와 같은 다양한 단어 임베딩 기법이 방글라 분류 성능에 미치는 영향은 무엇인가?
  • RQ4동일한 모델과 임베딩 기법을 사용할 때, 다중레이블 분류 성능은 단일레이블 분류 성능에 비해 어떻게 비교되는가?
  • RQ5어간화 처리의 사용이 방글라 텍스트 분류 모델의 성능에 뚜렷한 영향을 미치는가?

주요 결과

  • 수작업 레이블링에서 GRU에 FastText 임베딩을 사용한 모델이 91.83%의 정확도로 가장 높은 성능을 기록하였으며, 다른 딥러닝 및 머신러닝 모델을 압도하였다.
  • 자신의 다중레이블 분류에서 KNN에 Doc2Vec를 사용한 모델이 75%의 정확도로 모든 평가된 방법 중 가장 높은 성능을 보였다.
  • KNN는 90% 정밀도, 88% 재현도, 87% F1 점수로 다중레이블 성능에서 가장 균형 잡힌 성능을 보였으며, 지표 간의 균형이 잘 맞는 것으로 나타났다.
  • 해밍 손실이 낮았으며(다중레이블: 0.03, 원본 레이블: 0.09) 다중레이블 환경에서 고품질의 레이블 예측이 이루어졌음을 시사하였다.
  • 딥러닝 모델은 항상 머신러닝 모델보다 뛰어난 성능을 보였으며, 특히 FastText와 같은 문맥 기반 임베딩을 사용했을 때 두드러진 성능 향상을 보였다.
  • 어간화 처리의 사용이 모델 성능에 유의미한 영향을 주지 않았으며, 이는 이 맥락에서 형태소 정규화가 덜 중요한 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.