Skip to main content
QUICK REVIEW

[論文レビュー] AraCOVID19-SSD: Arabic COVID-19 Sentiment and Sarcasm Detection Dataset

Mohamed Seghir Hadj Ameur, Hassina Aliane|arXiv (Cornell University)|Oct 5, 2021
Sentiment Analysis and Opinion Mining参考文献 22被引用数 5
ひとこと要約

本稿では、COVID-19パンデミック期における二重タスク(センチメントおよび皮肉検出)のための、5,162件のツイートで構成される手動アノテーション付きアラビア語ツイッターデータセット、AraCOVID19-SSDを紹介する。bag-of-wordsモデルおよびトランスフォーマーモデル(BERT-multiおよびArabertを含む)を用いた実験により、皮肉検出で0.95を超える高いFスコア、センチメント分析で0.92を超える高いFスコアを達成した。これは、低リソースなアラビア語文脈におけるNLP研究において、本データセットの有効性を示している。

ABSTRACT

Coronavirus disease (COVID-19) is an infectious respiratory disease that was first discovered in late December 2019, in Wuhan, China, and then spread worldwide causing a lot of panic and death. Users of social networking sites such as Facebook and Twitter have been focused on reading, publishing, and sharing novelties, tweets, and articles regarding the newly emerging pandemic. A lot of these users often employ sarcasm to convey their intended meaning in a humorous, funny, and indirect way making it hard for computer-based applications to automatically understand and identify their goal and the harm level that they can inflect. Motivated by the emerging need for annotated datasets that tackle these kinds of problems in the context of COVID-19, this paper builds and releases AraCOVID19-SSD a manually annotated Arabic COVID-19 sarcasm and sentiment detection dataset containing 5,162 tweets. To confirm the practical utility of the built dataset, it has been carefully analyzed and tested using several classification models.

研究の動機と目的

  • COVID-19パンデミックの文脈における皮肉およびセンチメント検出のためのアノテーション付きアラビア語データセットが不足しているという問題に対処すること。
  • 低リソースおよび低リソースな状況においても、アラビア語NLP研究を支援できる高品質な手動アノテーション付きデータセットを提供すること。
  • 伝統的なbag-of-wordsモデルおよび最先端のトランスフォーマーモデルを含む多様なモデルの性能を、提案されたデータセット上で評価すること。
  • 公衆衛生危機期におけるアラビア語SNSでの皮肉およびセンチメント検出タスクのベースライン結果を確立すること。
  • データセットを公開し、新たな最新のツイートによる継続的な拡充を促進することで、今後の研究を支援すること。

提案手法

  • データセットは、COVID-19パンデミック関連のキーワードを用いてTwitterから収集されたもので、アラビア語のコンテンツに焦点を当てた。
  • 各ツイートは、人間の専門家による二重タスク(センチメント:ポジティブ、ネガティブ、ニュートラル)および皮肉(皮肉的、非皮肉的)の手動アノテーションが行われた。
  • 高品質なラベル付けを保証するため、アノテーター間の一貫性を確認するチェックを通じて、データセットは慎重に検証された。
  • 多数の分類モデルが訓練および評価された:ロジスティック回帰、ランダムフォレスト、SVM、およびトランスフォーマーベースのモデル(XLM-RoBERTa、BERT-multi、Arabert)。
  • 堅牢な評価と信頼性の高い性能指標を確保するため、層別化された5分割交差検証が用いられた。
  • 性能は重み付きFスコアを用いて測定され、両タスクについて適合率、再現率、F1スコアが報告された。

実験結果

リサーチクエスチョン

  • RQ1伝統的なbag-of-wordsモデルは、アラビア語COVID-19ツイートにおける皮肉およびセンチメント検出にどの程度効果的か?
  • RQ2BERTやXLM-RoBERTaのような事前学習済みトランスフォーマーモデルを用いることで、このアラビア語NLPタスクでどの程度の性能向上が達成できるか?
  • RQ3手動アノテーション付きデータセットの品質とサイズは、モデルの汎化性能および性能にどのように影響するか?
  • RQ4どのモデルアーキテクチャが、低リソースなアラビア語テキストにおける皮肉検出で最高のFスコアを達成するか?
  • RQ5データセットのアノテーションスキーマは、アラビア語SNS NLPにおける信頼性の高い再現可能な評価をどの程度サポートするか?

主な発見

  • SVMモデルが皮肉検出で最高のFスコア0.9597を達成し、他のすべてのモデルを上回った。
  • Arabertモデルは皮肉検出でFスコア0.9527、センチメント分析でFスコア0.9226を達成し、アラビア語固有の事前学習済みモデルの優れた性能を示した。
  • 全テストモデルがFスコア0.89以上を達成しており、これはデータセットが高精度な分類タスクをサポートしていることを示している。
  • XLM-RoBERTaモデルは皮肉検出でFスコア0.9360を達成し、多言語環境下での強力なゼロショット転送能力を示した。
  • BERT-multiモデルは皮肉検出でFスコア0.9416を達成し、低リソース状況下での多言語BERTの有効性を強調した。
  • 全モデルで高いFスコアが達成されたことから、データセットの品質およびアノテーションスキーマがアラビア語NLP研究において実用的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。