[論文レビュー] Sentiment Analysis for YouTube Comments in Roman Urdu
本研究では、5つの機械学習モデルを用いてローマンウルドゥー語のYouTubeコメントの教師ありセンチメント分析フレームワークを提案する。bag-of-words特徴抽出を適用し、14,131件のサンプルからなるデータセットで分類器を評価した結果、SVMが64%の最高精度を達成し、ナイーブベイズ、線形回帰、KNN、MLPを上回った。
Sentiment analysis is a vast area in the Machine learning domain. A lot of work is done on datasets and their analysis of the English Language. In Pakistan, a huge amount of data is in roman Urdu language, it is scattered all over the social sites including Twitter, YouTube, Facebook and similar applications. In this study the focus domain of dataset gathering is YouTube comments. The Dataset contains the comments of people over different Pakistani dramas and TV shows. The Dataset contains multi-class classification that is grouped The comments into positive, negative and neutral sentiment. In this Study comparative analysis is done for five supervised learning Algorithms including linear regression, SVM, KNN, Multi layer Perceptron and Naïve Bayes classifier. Accuracy, recall, precision and F-measure are used for measuring performance. Results show that accuracy of SVM is 64 percent, which is better than the rest of the list.
研究の動機と目的
- パキスタンで広く使われる非公式なスクリプトであるローマンウルドゥー語のユーザーコメントの自動センチメント分類を可能にすること。
- 低リソース言語としてのローマンウルドゥー語におけるセンチメント分析のためのラベル付きデータセットとモデルの不足に対処すること。
- 5つの教師あり学習アルゴリズム(ナイーブベイズ、線形回帰、SVM、KNN、MLP)が、3クラス(ポジティブ、ネガティブ、ニュートラル)のローマンウルドゥー語コメントデータセット上でどのように性能を発揮するかを比較すること。
- 10分割交差検証を用いて、標準指標(正確性、適合率、再現率、F1スコア)を用いてモデルの性能を評価すること。
- 南アジア言語における低リソース・スクリプト固有のセンチメント分析分野における今後の研究の基盤を提供すること。
提案手法
- Kaggleから入手した14,131件のローマンウルドゥー語のYouTubeコメントのラベル付きデータセットを収集し、センチメントラベル(ポジティブ、ネガティブ、ニュートラル)を手動で割り当てた。
- テキスト前処理として、欠損値の削除と、ベクトル化のための単語特徴へのトークン化を実施した。
- テキストコーパスから最も頻出する3,000の特徴を抽出するために、bag-of-words(BoW)手法を用いた。
- データセットを90%のトレーニングデータと10%のテストデータに分割し、10分割交差検証を用いて堅牢な評価を確保した。
- ナイーブベイズ、線形回帰、SVM、K-近傍法(KNN)、多層パーセプトロン(MLP)の5つの教師あり分類器をトレーニングおよび評価した。
- 混同行列と標準指標(正確性、適合率、再現率、F1スコア)を用いて性能を測定し、10回の実行の平均値を算出した。
実験結果
リサーチクエスチョン
- RQ1ローマンウルドゥー語のYouTubeコメントのセンチメント分類において、どの教師あり機械学習アルゴリズムが最も優れた性能を示すか?
- RQ2伝統的な分類器(例:SVM、ナイーブベイズ)とニューラルネットワーク(例:MLP)の性能は、低リソースのローマンウルドゥー語テキストにおいてどのように比較されるか?
- RQ3特徴選択(3,000特徴を有するbag-of-words)が、非公式なローマンウルドゥー語のセンチメント分析におけるモデルの正確性に与える影響は何か?
- RQ4データセットにおけるセンチメントの分布はどれほどバランスが取れているか?クラスの不均衡はモデルの一般化に影響を及えるか?
- RQ5ラベル付きデータが限られた低リソース言語、たとえばローマンウルドゥー語において、多クラスセンチメント分類モデルが妥当な性能を達成できるか?
主な発見
- SVMはテストセットで64%の最高正確性を達成し、他のすべてのモデルを上回った。
- ナイーブベイズは正確性が60%未満のやや低い性能を示し、ローマンウルドゥー語の言語的複雑さに対処する能力の限界を示した。
- 線形回帰は正確性が著しく低く、SVMやKNNに比べて著しく劣っており、この多クラスNLPタスクには不適切であることが示された。
- KNNとMLPは同等の性能を示し、線形回帰を上回ったがSVMに劣り、F1スコアはいずれも約0.55〜0.58であった。
- データセットは不均衡であり、ニュートラルが48%、ポジティブが29%、ネガティブが24%を占めており、これがモデルのバイアスや一般化性能に影響を与えた可能性がある。
- 全体的な正確性が低くても、SVMは特にポジティブおよびニュートラルクラスの再現率とF1スコアにおいて、最も安定した性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。