Skip to main content
QUICK REVIEW

[論文レビュー] Text classification dataset and analysis for Uzbek language

Elmurod Kuriyozov, Ulugbek Salaev|arXiv (Cornell University)|Feb 28, 2023
Text and Document Classification Technologies被引用数 4
ひとこと要約

本稿では、15のカテゴリーにわたり10のニュース・プレスWebサイトから収集したウズベク語の新しいマルチラベルテキスト分類データセットを紹介する。伝統的なモデルとディープラーニングモデルの評価を行い、トランスフォーマーに基づくBERTbekがRNN、CNN、ルールベースモデルを上回ることを示し、今後のウズベク語NLP研究の強固なベースラインを確立する。

ABSTRACT

Text classification is an important task in Natural Language Processing (NLP), where the goal is to categorize text data into predefined classes. In this study, we analyse the dataset creation steps and evaluation techniques of multi-label news categorisation task as part of text classification. We first present a newly obtained dataset for Uzbek text classification, which was collected from 10 different news and press websites and covers 15 categories of news, press and law texts. We also present a comprehensive evaluation of different models, ranging from traditional bag-of-words models to deep learning architectures, on this newly created dataset. Our experiments show that the Recurrent Neural Network (RNN) and Convolutional Neural Network (CNN) based models outperform the rule-based models. The best performance is achieved by the BERTbek model, which is a transformer-based BERT model trained on the Uzbek corpus. Our findings provide a good baseline for further research in Uzbek text classification.

研究の動機と目的

  • ウズベク語向けの大規模なマルチラベルテキスト分類データセットを構築し、NLP研究を支援すること。
  • Bag-of-wordsからディープラーニングに至る多様なモデル—特にウズベク語テキスト分類における性能を評価すること。
  • ルールベース、RNN、CNN、トランスフォーマーに基づくモデルを比較することで、低リソース言語としてのウズベク語NLP研究のためのベンチマークを確立すること。
  • 低リソース言語であるウズベク語におけるマルチラベルニュース分類のためのデータセット構築手法と評価プロトコルを分析すること。

提案手法

  • 10の多様なウズベク語ニュース・プレスWebサイトからテキストデータを収集し、トピックとスタイルの広範なカバレッジを確保した。
  • 15の事前定義されたカテゴリー(ニュース、プレスリリース、法的文書など)を用いてデータセットをマルチラベル分類用にアノテーションした。
  • ルールベース分類器、伝統的なBag-of-WordsとSVM、RNN、CNN、およびウズベク語コーパスで微調整されたBERTbekモデルを実装・評価した。
  • ディープラーニングモデルの入力準備のため、標準的なNLP前処理手順(トークン化、シーケンスパディングなど)を適用した。
  • モデルのパフォーマンスを比較するために、マクロ-F1、ミクロ-F1、正解率といった標準的な評価指標を用いた。
  • ウズベク語テキストで事前学習された多言語Bertの変種であるBERTbekモデルを、マルチラベル分類タスクに最適化するため微調整した。

実験結果

リサーチクエスチョン

  • RQ1ルールベースおよび伝統的な機械学習モデルは、ウズベク語テキスト分類においてどの程度のパフォーマンスを示すか?
  • RQ2RNNとCNNアーキテクチャは、マルチラベルウズベク語テキスト分類においてどのように比較されるか?
  • RQ3ウズベク語データで微調整されたBERTベースのモデルは、非トランスフォーマー系モデルに比べて分類精度をどの程度向上させるか?
  • RQ4低リソース言語(ウズベク語など)向けに高品質なマルチラベルデータセットを構築するにあたり、どのような主な課題があるか?

主な発見

  • BERTbekモデルが、RNNやCNNを含むすべての他のモデルを上回る最高のパフォーマンスを達成した。
  • RNNおよびCNNモデルは、ルールベースベースラインに比べて顕著な向上を示し、ウズベク語NLPにおけるディープラーニングの価値を示した。
  • マルチラベルデータセットは15の異なるカテゴリーをカバーしており、ニュース、プレス、法的文書など多様なコンテンツを含んでおり、その代表性が高まっている。
  • 本研究により、ウズベク語テキスト分類の新しいベンチマークが確立され、BERTbekが今後の研究における強固なパフォーマンスベースラインを設定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。