Skip to main content
QUICK REVIEW

[論文レビュー] COVID-19-related Nepali Tweets Classification in a Low Resource Setting

Rabin Adhikari, Safal Thapaliya|arXiv (Cornell University)|Oct 11, 2022
Misinformation and Its Impacts被引用数 4
ひとこと要約

この論文では、多言語トランスフォーマー・モデル(mBERT と MuRIL)を用いて、8つの主要なトピックに分類する低リソースNLPパイプラインを提案している。ウェブベースのダッシュボードを実装し、トレンドを可視化しており、大規模なデータセットでは MuRIL が mBERT を上回ることを示している。すべてのデータ、モデル、ツールは公開されており、一般利用可能である。

ABSTRACT

Billions of people across the globe have been using social media platforms in their local languages to voice their opinions about the various topics related to the COVID-19 pandemic. Several organizations, including the World Health Organization, have developed automated social media analysis tools that classify COVID-19-related tweets into various topics. However, these tools that help combat the pandemic are limited to very few languages, making several countries unable to take their benefit. While multi-lingual or low-resource language-specific tools are being developed, they still need to expand their coverage, such as for the Nepali language. In this paper, we identify the eight most common COVID-19 discussion topics among the Twitter community using the Nepali language, set up an online platform to automatically gather Nepali tweets containing the COVID-19-related keywords, classify the tweets into the eight topics, and visualize the results across the period in a web-based dashboard. We compare the performance of two state-of-the-art multi-lingual language models for Nepali tweet classification, one generic (mBERT) and the other Nepali language family-specific model (MuRIL). Our results show that the models' relative performance depends on the data size, with MuRIL doing better for a larger dataset. The annotated data, models, and the web-based dashboard are open-sourced at https://github.com/naamiinepal/covid-tweet-classification.

研究の動機と目的

  • ネパール語ツイートにおけるCOVID-19関連議論の8つの主要トピックを特定すること。
  • パンデミック期におけるネパール語のソーシャルメディアコンテンツの収集・分類・可視化を自動化するパイプラインを開発すること。
  • 多言語モデル(mBERT)とネパール語最適化モデル(MuRIL)の低リソースネパール語テキスト分類における性能を評価すること。
  • リアルタイムでの公衆の感情やトピックトレンドの監視が可能な、公開可能なウェブベースのダッシュボードを構築・リリースすること。

提案手法

  • TwitterからCOVID-19関連用語を含むネパール語ツイートを収集するキーワードベースのウェブクローラーを構築した。
  • テーマ的コンテンツに基づいて、ネパール語ツイートのデータセットを8つの事前に定義されたトピックにアノテートした。
  • アノテートされたデータセットを用いて、2つの多言語トランスフォーマーモデル(mBERT と MuRIL)を微調整し、テキスト分類に使用した。
  • 分類されたツイートのトピック分布と時間的トレンドを可視化するウェブベースのダッシュボードを実装した。
  • 標準的な分類指標を用いてモデルの性能を比較し、データセットサイズがモデルの正確性に与える影響を分析した。
  • アノテートされたデータセット、トレーニング済みモデル、ダッシュボードのコードをすべてオープンソース化し、研究コミュニティによる再利用・拡張を可能にした。

実験結果

リサーチクエスチョン

  • RQ1ネパール語ツイートにおけるCOVID-19関連議論で最も一般的な8つのトピックは何か?
  • RQ2mBERT などの多言語モデルと MuRIL などの言語特化モデルは、低リソースネパール語テキスト分類においてどのように性能を発揮するか?
  • RQ3データセットサイズが、ネパール語ツイート分類における mBERT と MuRIL の相対的性能に顕著な影響を与えるか?
  • RQ4自動パイプラインは、低リソース言語のソーシャルメディア上で、リアルタイムの公衆感情を効果的に収集・分類・可視化できるか?
  • RQ5オープンソースツールは、低リソース言語的環境における公衆衛生の監視をどの程度支援できるか?

主な発見

  • ネパール語COVID-19ツイートで最も一般的な8つのトピックは、症状、ワクチン、誤情報、政府の政策、メンタルヘルス、経済的影響、検査、渡航制限であった。
  • より大きなアノテート済みデータセットで微調整した場合、MuRIL がネパール語ツイート分類タスクで mBERT を上回った。
  • データセットが小さい場合、mBERT と MuRIL の性能差が縮まり、MuRIL の利点が十分な訓練データがある場合に顕著に現れることが示された。
  • ウェブベースのダッシュボードは、公衆議論の時間的トレンドを効果的に可視化し、トピックの頻度のリアルタイム監視を可能にした。
  • データ、モデル、ダッシュボードを含むパイプライン全体がオープンソースとしてリリースされ、低リソースNLP分野における再現性と今後の拡張を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。