[논문 리뷰] Text classification dataset and analysis for Uzbek language
이 논문은 15개의 카테고리로 나누어 10개의 뉴스 및 언론 웹사이트에서 수집한 자료를 바탕으로 우즈베크어를 위한 새로운 다중 레이블 텍스트 분류 데이터셋을 소개한다. 기존의 및 딥러닝 기반 모델을 평가한 결과, 트랜스포머 기반의 BERTbek 모델이 RNN, CNN 및 규칙 기반 모델을 모두 앞서는 성능을 보이며 향후 우즈베크어 NLP 연구를 위한 강력한 베이스라인을 확립한다.
Text classification is an important task in Natural Language Processing (NLP), where the goal is to categorize text data into predefined classes. In this study, we analyse the dataset creation steps and evaluation techniques of multi-label news categorisation task as part of text classification. We first present a newly obtained dataset for Uzbek text classification, which was collected from 10 different news and press websites and covers 15 categories of news, press and law texts. We also present a comprehensive evaluation of different models, ranging from traditional bag-of-words models to deep learning architectures, on this newly created dataset. Our experiments show that the Recurrent Neural Network (RNN) and Convolutional Neural Network (CNN) based models outperform the rule-based models. The best performance is achieved by the BERTbek model, which is a transformer-based BERT model trained on the Uzbek corpus. Our findings provide a good baseline for further research in Uzbek text classification.
연구 동기 및 목표
- NLP 연구를 지원하기 위해 대규모 다중 레이블 텍스트 분류 데이터셋을 구축하기 위해 우즈베크어를 위한 대규모 다중 레이블 텍스트 분류 데이터셋을 만든다.
- 백오프 워드에서 딥러닝에 이르기까지 다양한 모델—ranging from bag-of-words to deep learning—이 우즈베크어 텍스트 분류에서 성능을 평가한다.
- 규칙 기반, RNN, CNN, 트랜스포머 기반 모델를 비교하여 저자원 우즈베크어 NLP 연구를 위한 벤치마크를 설정한다.
- 다중 레이블 뉴스 분류를 위한 데이터셋 구축 기법과 평가 프로토콜을 분석한다.
제안 방법
- 다양한 우즈베크어 뉴스 및 언론 웹사이트 10개에서 텍스트 데이터를 수집하여 주제와 스타일의 광범위한 커버리지 확보.
- 뉴스, 보도자료, 법적 문서를 포함한 15개의 사전 정의된 카테고리로 데이터셋을 다중 레이블 분류를 위해 주석 처리.
- 규칙 기반 분류기, 전통적인 백오프 워드 모델에 기반한 SVM, RNN, CNN, 그리고 우즈베크어 코퍼스에 맞추어 미세조정된 BERTbek 모델을 구현하고 평가.
- 딥러닝 모델에 대비해 토크나이제이션 및 시퀀스 패딩과 같은 표준 NLP 전처리 단계를 적용.
- 모델 성능을 카테고리 간 비교하기 위해 매크로-F1, 마이크로-F1, 정확도와 같은 표준 평가 지표를 사용.
- 우즈베크어 텍스트에 사전 훈련된 다국어 BERT 변종인 BERTbek 모델을 다중 레이블 분류 작업에 최적화하기 위해 미세조정.
실험 결과
연구 질문
- RQ1규칙 기반 및 전통적인 머신러닝 모델은 우즈베크어 텍스트 분류에서 어떤 성능을 보이는가?
- RQ2RNN과 CNN 아키텍처는 다중 레이블 우즈베크어 텍스트 분류에서 어떻게 비교되는가?
- RQ3우즈베크어 데이터에 맞추어 미세조정된 BERT 기반 모델은 비트랜스포머 모델보다 분류 정확도를 얼마나 향상시키는가?
- RQ4저자원 언어인 우즈베크어를 위한 고품질 다중 레이블 데이터셋을 구축하는 데 있어 주요 과제는 무엇인가?
주요 결과
- BERTbek 모델이 다른 모든 모델, RNN 및 CNN을 포함하여 우즈베크어 텍스트 분류 데이터셋에서 최고의 성능을 기록했다.
- RNN 및 CNN 모델은 규칙 기반 기반선보다 뚜렷한 향상을 보이며, 우즈베크어 NLP에서 딥러닝의 가치를 입증했다.
- 다중 레이블 데이터셋은 뉴스, 보도자료, 법적 자료에서 온 다양한 콘텐츠를 포함하여 15개의 고유한 카테고리로 구성되어 있어 대표성을 높였다.
- 이 연구는 우즈베크어 텍스트 분류를 위한 새로운 벤치마크를 확립하였으며, BERTbek은 향후 연구를 위한 강력한 성능 기반을 설정했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.