Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment Analysis of Code-Mixed Social Media Text (Hinglish)

Gaurav Singh|arXiv (Cornell University)|Feb 24, 2021
Sentiment Analysis and Opinion Mining参考文献 15被引用数 6
ひとこと要約

本論文は、複数の自然言語処理技術を用いて、ヒングルーシュ(ヒンディー語-英語混合)のTwitterテキストにおけるセンチメント分析について包括的な研究を提示している。反復的なデータクリーニング、さまざまな特徴抽出手法(TF-IDF、ワードエムベッディング)、多様な機械学習モデルを適用し、SemEval-2020 Task 9データセットで最高のF1スコア69.07を達成したアンサンブル投票分類器を実現した。

ABSTRACT

This paper discusses the results obtained for different techniques applied for performing the sentiment analysis of social media (Twitter) code-mixed text written in Hinglish. The various stages involved in performing the sentiment analysis were data consolidation, data cleaning, data transformation and modelling. Various data cleaning techniques were applied, data was cleaned in five iterations and the results of experiments conducted were noted after each iteration. Data was transformed using count vectorizer, one hot vectorizer, tf-idf vectorizer, doc2vec, word2vec and fasttext embeddings. The models were created using various machine learning algorithms such as SVM, KNN, Decision Trees, Random Forests, Naive Bayes, Logistic Regression, and ensemble voting classifiers. The data was obtained from a task on Codalab competition website which was listed as Task:9 on the Semeval-2020 competition website. The models created were evaluated using the F1-score (macro). The best F1-score of 69.07 was achieved using ensemble voting classifier.

研究の動機と目的

  • 低リソースでコードミックスされたソーシャルメディアテキスト、特にヒングルーシュ(ヒンディー語-英語混合)コンテンツにおけるセンチメント分析の課題に対処すること。
  • コードミックステキストにおけるさまざまなデータ前処理、特徴工学、機械学習技術の有効性を評価すること。
  • ヒングルーシュにおけるセンチメント分類の最適な前処理、特徴抽出、モデリングアプローチの組み合わせを特定すること。
  • 多言語的で非公式なソーシャルメディアテキストにおけるセンチメント分析の再現可能なパイプラインを貢献すること。

提案手法

  • データは、CodalabにおけるSemEval-2020 Task 9コンペティションから収集され、ヒングルーシュのTwitter投稿に焦点を当てた。
  • テキスト品質と一貫性を向上させるために、5段階の反復的データクリーニングが適用された。
  • 特徴表現には、カウントベクトルライザー、ワンホットエンコーディング、TF-IDF、およびワードエムベッディング(Word2Vec、FastText、Doc2Vec)が使用された。
  • SVM、KNN、決定木、ランダムフォレスト、ナイーブベイズ、ロジスティック回帰、アンサンブル投票分類器を含む複数の機械学習モデルが訓練された。
  • 分類ラベルのクラス不均衡を考慮するため、マクロF1スコアを用いてモデル評価が行われた。
  • アンサンブル投票分類器は、複数のベースモデルの予測を統合して全体的な性能を向上させた。

実験結果

リサーチクエスチョン

  • RQ1どのデータクリーニング戦略がヒングルーシュテキストのセンチメント分類性能向上に最も効果的か?
  • RQ2異なる特徴表現手法(例:TF-IDF対ワードエムベッディング)は、コードミックステキストにおけるモデル精度にどのように影響するか?
  • RQ3どの機械学習アルゴリズムがヒングルーシュソーシャルメディアコンテンツのセンチメント分類に最も適しているか?
  • RQ4この低リソースでコードミックスされたNLP環境において、アンサンブル手法は個々のモデルを上回る性能を示せるか?
  • RQ5前処理、特徴抽出、モデリングを組み合わせた最適なパイプラインは何か?

主な発見

  • 反復的データクリーニングプロセスによりモデル性能が顕著に向上し、5回のクリーニング反復後に最高の結果が得られた。
  • アンサンブル投票分類器が最高のF1スコア69.07を達成し、すべての個々のモデルを上回った。
  • TF-IDFおよびワードエムベッディングベースの特徴(特にFastText)は強力な性能を示し、一部の設定ではTF-IDFがわずかに優れた結果を出した。
  • 個々のモデルの中で、ランダムフォレストとSVMは比較的高いF1スコアを示したが、アンサンブルアプローチに及ばなかった。
  • 複数のモデルを投票で統合することは、コードミックスで低リソースなテキストにおけるセンチメント分類の向上に効果的な戦略であると確認された。
  • 結果から、非公式で多言語的なソーシャルメディアテキストにおいて、慎重な前処理と特徴工学が高い性能を達成するために不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。