Skip to main content
QUICK REVIEW

[論文レビュー] Code-Mixed Sentiment Analysis Using Machine Learning and Neural Network Approaches

Pruthwik Mishra, Prathyusha Danda|arXiv (Cornell University)|Aug 9, 2018
Natural Language Processing Techniques参考文献 11被引用数 12
ひとこと要約

本論文では、インドの言語ペア(Hi-EnおよびBen-Hi-En)におけるコードミックスドセンチメント分析のための機械学習およびニューラルネットワーク手法を提示する。TF-IDF文字n-gram(n=2から6)を用い、線形SVMとアンサンブル投票分類器を適用した。線形SVMモデル(Run2)が最高のパフォーマンスを示し、SAIL-Code Mixedツールコンテストで、Hi-EnのFスコア0.569およびBen-Hi-EnのFスコア0.526を記録し、優勝を獲得した。

ABSTRACT

Sentiment Analysis for Indian Languages (SAIL)-Code Mixed tools contest aimed at identifying the sentence level sentiment polarity of the code-mixed dataset of Indian languages pairs (Hi-En, Ben-Hi-En). Hi-En dataset is henceforth referred to as HI-EN and Ben-Hi-En dataset as BN-EN respectively. For this, we submitted four models for sentiment analysis of code-mixed HI-EN and BN-EN datasets. The first model was an ensemble voting classifier consisting of three classifiers - linear SVM, logistic regression and random forests while the second one was a linear SVM. Both the models used TF-IDF feature vectors of character n-grams where n ranged from 2 to 6. We used scikit-learn (sklearn) machine learning library for implementing both the approaches. Run1 was obtained from the voting classifier and Run2 used the linear SVM model for producing the results. Out of the four submitted outputs Run2 outperformed Run1 in both the datasets. We finished first in the contest for both HI-EN with an F-score of 0.569 and BN-EN with an F-score of 0.526.

研究の動機と目的

  • コードミックスドインド語テキストにおけるセンチメント分析の課題に取り組むこと、特にヒンディー語-英語(Hi-En)およびベンガル語-ヒンディー語-英語(Ben-Hi-En)言語ペアを対象とする。
  • リソースが限られた低リソースの混合言語テキストにおいて、文単位のセンチメント極性を正確に分類できる強固な機械学習およびニューラルネットワークモデルを開発すること。
  • コードミックスドセンチメント分析のためのSAIL-Code Mixedツールコンテストに参加し、最高のパフォーマンスを達成すること。
  • この低リソースで多言語的な文脈において、アンサンブル投票分類器と単体の線形SVMモデルの有効性を比較すること。

提案手法

  • n=2から6の範囲で変動する文字n-gramのTF-IDFベクトルを用いた特徴抽出により、サブワード言語的パターンを捉える。
  • 線形SVM、ロジスティック回帰、ランダムフォレストを組み合わせた投票アンサンブル分類器の実装により、一般化性能の向上を図る。
  • 比較のためのベースラインおよび代替アプローチとして、単体の線形SVMモデルを用いる。
  • scikit-learn(sklearn)ライブラリを用いてSAIL-Code Mixedデータセット上でモデルの学習と評価を実施する。
  • 4つのモデル出力を提出し、性能比較にRun1(アンサンブル)とRun2(線形SVM)を用いた。
  • SAIL-Code MixedツールコンテストにおけるHi-EnおよびBen-Hi-Enデータセットの両方で、Fスコアに基づいた評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1TF-IDF文字n-gramを用いた線形SVMモデルは、コードミックスドヒンディー語-英語テキストにおけるセンチメント分類にどの程度有効であるか?
  • RQ2多様な分類器のアンサンブルは、リソースが限られたコードミックスドセンチメント分析において、個々のモデルを上回る性能を発揮できるか?
  • RQ3この特定のコードミックスドセンチメントタスクにおいて、機械学習モデルとニューラルネットワークアプローチの相対的なパフォーマンスはいかほどか?
  • RQ4TF-IDF文字n-gramは、コードミックスドインド語におけるセンチメントを捉えるために他の特徴表現と比較してどの程度優れているか?
  • RQ5従来の機械学習手法のみを用いて、SAIL-Code Mixedデータセットでどの程度のパフォーマンスが達成可能か?

主な発見

  • 線形SVMモデル(Run2)は、Hi-EnおよびBen-Hi-Enの両データセットでアンサンブル投票分類器(Run1)を上回った。
  • 線形SVMは、Hi-EnデータセットでFスコア0.569を達成し、SAIL-Code Mixedツールコンテストで第1位を獲得した。
  • 線形SVMは、Ben-Hi-EnデータセットでもFスコア0.526を達成し、同コンテストで第1位となった。
  • アンサンブルモデル(Run1)は、単体の線形SVMに比べて低いパフォーマンスを示し、この文脈ではモデルの複雑さが結果の向上に寄与しなかった。
  • TF-IDF文字n-gram(n=2から6)は、コードミックスドテキストにおけるセンチメント関連のパターンを効果的に捉えることができた。
  • 結果から、適切な特徴工学を施した従来の機械学習モデルが、リソースが限られたコードミックスドセンチメント分析タスクで最先端のパフォーマンスを達成できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。