Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment and Emotion Classification of Epidemic Related Bilingual data from Social Media

Muhammad Zain Ali, Kashif Javed|arXiv (Cornell University)|May 4, 2021
Sentiment Analysis and Opinion Mining被引用数 6
ひとこと要約

本研究は、パキスタンにおけるデング熱の早期発生信号を検出するために、TwitterおよびニュースWebサイトからのソーシャルメディアデータを用いて、ウルドゥ語および英語の二言語対応の感情および感情分類フレームワークを提案する。機械学習およびディープラーニングモデル、特にアテンションを備えた双方向LSTMを採用し、英語の感情分類で84.4%、ウルドゥ語で78.4%の正確性を達成した。従来のモデルを上回り、多値分類分類器は1対restアプローチよりも高い再現率を示した。

ABSTRACT

In recent years, sentiment analysis and emotion classification are two of the most abundantly used techniques in the field of Natural Language Processing (NLP). Although sentiment analysis and emotion classification are used commonly in applications such as analyzing customer reviews, the popularity of candidates contesting in elections, and comments about various sporting events; however, in this study, we have examined their application for epidemic outbreak detection. Early outbreak detection is the key to deal with epidemics effectively, however, the traditional ways of outbreak detection are time-consuming which inhibits prompt response from the respective departments. Social media platforms such as Twitter, Facebook, Instagram, etc. allow the users to express their thoughts related to different aspects of life, and therefore, serve as a substantial source of information in such situations. The proposed study exploits the bilingual (Urdu and English) data from Twitter and NEWS websites related to the dengue epidemic in Pakistan, and sentiment analysis and emotion classification are performed to acquire deep insights from the data set for gaining a fair idea related to an epidemic outbreak. Machine learning and deep learning algorithms have been used to train and implement the models for the execution of both tasks. The comparative performance of each model has been evaluated using accuracy, precision, recall, and f1-measure.

研究の動機と目的

  • パキスタンにおけるデング熱流行に関連する二言語(ウルドゥ語および英語)のソーシャルメディアデータを対象とした感情および感情分類システムの開発を目的とする。
  • パキスタンにおけるデング熱流行期に、機械学習およびディープラーニングモデルのパフォーマンスを、一般の感情および感情分類の文脈で評価することを目的とする。
  • 感情および感情分類タスクにおいて、1対restと多値分類の戦略の有効性を比較することを目的とする。
  • ソーシャルメディアデータを、疾病の流行監視のためのリアルタイム監視ツールとして使用可能かどうかを検討することを目的とする。

提案手法

  • パキスタンにおけるデング熱流行期に、TwitterおよびニュースWebサイトから二言語(ウルドゥ語および英語)の流行関連データを収集した。
  • NLTKの語彙ライブラリからの動的カットオフスコアを用いて感情ラベルを割り当て、コンテンツベースの感情アノテーションを実施した。
  • ウルドゥ語のような低リソース言語に適した標準的なNLP技術を用いてテキストを前処理した。
  • 複数のモデルを訓練および評価した:多項式ベイズ、線形SVM、1次元CNN、LSTM、双方向LSTM、およびアテンション機構を備えたLSTM。
  • 重み付き適合率および再現率の指標を用いて、1対restと多値分類の戦略を比較した。
  • 両言語において、正確性、適合率、再現率、F1スコアの指標を用いてモデルのパフォーマンスを評価した。

実験結果

リサーチクエスチョン

  • RQ1機械学習およびディープラーニングモデルは、二言語(ウルドゥ語および英語)の流行関連ソーシャルメディアデータにおける感情および感情分類において、どの程度効果的か?
  • RQ2感情および感情分類タスクにおいて、1対restと多値分類の戦略のパフォーマンスを比較すると、それぞれどうなるか?
  • RQ3この文脈において、なぜディープラーニングモデルが従来の機械学習モデルを上回るのか?
  • RQ4データの不均衡およびクラス分布は、特にカテゴリ数の多い感情分類において、モデルのパフォーマンスにどのように影響を与えるか?

主な発見

  • ディープラーニングモデル、特にアテンション機構を備えた双方向LSTMは、英語の感情分類で84.4%、ウルドゥ語の感情分類で78.4%の最高正確性を達成した。
  • ディープラーニングモデルのパフォーマンスは、機械学習モデルを常に上回り、多項式ベイズが特にポジティブ感情の再現率において最も弱いパフォーマンスを示した。
  • 多値分類は1対rest分類を上回り、より高い重み付き再現率(実際のポジティブケースの検出が優れていることを示唆)を示したが、1対rest分類はより高い重み付き適合率を示した。
  • 感情分類モデルのパフォーマンスは、中立サンプルを除外した後のデータ密度の低下により、感情分類モデルより劣った。これは、過学習の原因となった。
  • アテンション機構を備えた双方向LSTMは、感情分類において標準の双方向LSTMを上回ったが、感情分類では逆にパフォーマンスが劣った。これは、タスク固有のモデル行動を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。