[論文レビュー] A Study of Feature Extraction techniques for Sentiment Analysis
本研究では、5つのベンチマークデータセットを用いて、複数の分類器を用いて感情分析におけるTF-IDFとDoc2Vecの有効性を評価した。Doc2Vecは、特に小規模でドメイン特化したレビューにおいてTF-IDFを上回り、ロジスティック回帰とSVM-RBFが最も高い正答率を示した。これは、分散表現を用いた文の表現が、従来の単語頻度手法に比べて感情分類を向上させることを示している。
Sentiment Analysis refers to the study of systematically extracting the meaning of subjective text . When analysing sentiments from the subjective text using Machine Learning techniques,feature extraction becomes a significant part. We perform a study on the performance of feature extraction techniques TF-IDF(Term Frequency-Inverse Document Frequency) and Doc2vec (Document to Vector) using Cornell movie review datasets, UCI sentiment labeled datasets, stanford movie review datasets,effectively classifying the text into positive and negative polarities by using various pre-processing methods like eliminating StopWords and Tokenization which increases the performance of sentiment analysis in terms of accuracy and time taken by the classifier.The features obtained after applying feature extraction techniques on the text sentences are trained and tested using the classifiers Logistic Regression,Support Vector Machines,K-Nearest Neighbours , Decision Tree and Bernoulli Nave Bayes
研究の動機と目的
- TF-IDFとDoc2Vecが感情分析における特徴抽出手法として有効であるかを評価すること。
- ストップワードの除去やトークン化などの前処理手順が分類精度に与える影響を評価すること。
- ロジスティック回帰、SVM、KNN、決定木、ベルヌーイナイーブベイズといった複数の分類器が、それぞれの特徴抽出手法と組み合わせられた場合の性能を比較すること。
- さまざまなサイズの感情分類データセットにおいて、どの特徴抽出手法がより高い正答率を達成するかを特定すること。
- 実世界の感情分類タスクにおけるTF-IDFとDoc2Vecの適正性について、実証的洞察を提供すること。
提案手法
- ハイパーパラメータとしてmax_df、use_idf、sublinear_tf、ストップワードフィルタリングを用いたTF-IDFの適用。
- 最適化されたハイパーパラメータを用いたDoc2Vecの使用:min_count、windowサイズ、ベクターサイズ、ネガティブサンプリング、ワーカー数、dm(0でCBOW、1でスキップグラム)、エポック数。
- 特徴抽出の前段階として、トークン化とストップワード除去によるテキストの前処理。
- 5つのベンチマークデータセット(コロンビア映画レビュー、UCI感情ラベル付き、スタンフォード映画レビュー、およびスタンフォードとコロンビアのより大きなデータセット)に対して分類器を訓練および評価。
- 主な評価指標として正答率を用い、真陽性、偽陽性、などから成る2×2の連関表から計算した。
- データセットのサイズに応じた比較分析を実施し、各手法のスケーラビリティとロバストネスを評価した。
実験結果
リサーチクエスチョン
- RQ1多様な感情分類データセットにおいて、TF-IDFとDoc2Vecの分類精度はどのように比較されるか?
- RQ2どの前処理と特徴抽出の組み合わせが、最も高い感情分類正答率を達成するか?
- RQ3TF-IDFとDoc2Vecを用いた場合、さまざまなデータセットサイズにおいて、どの分類器が最も優れた性能を示すか?
- RQ4特にリソースが限られた環境やドメイン特化した設定において、Doc2Vecは一貫してTF-IDFを上回るのか?
- RQ5TF-IDFとDoc2Vecにおけるハイパーパラメータ設定が、最終的な感情予測性能にどのように影響するか?
主な発見
- Doc2Vecは5つのデータセットのうち4つでTF-IDFを上回る正答率を達成し、特に小規模でドメイン特化したデータセット(例:データセット-4)では、ロジスティック回帰を用いて99.98%の正答率を記録した。
- データセット-1(1,500件のレビュー)では、すべての分類器においてDoc2VecがTF-IDFを上回り、SVM-RBFは86.86%の正答率を達成したのに対し、TF-IDFは75.14%であった。
- データセット-5(大規模な映画レビュー)では、TF-IDFがわずかにDoc2Vecを上回り、ロジスティック回帰は88.46%の正答率を記録したのに対し、Doc2Vecは86.49%であった。
- ロジスティック回帰とRBFカーネルおよび線形カーネルを用いたSVMは、両方の特徴抽出手法において一貫して最も高い正答率を示し、感情分類タスクにおけるその頑健性を示している。
- データセット-2(2,000件のレビュー)では、TF-IDFがDoc2Vecを上回り、SVM-RBFは82.35%の正答率を達成したのに対し、Doc2Vecは77.40%であった。
- 手法間の性能差はデータセットのサイズやドメインによって変動し、ドメイン特化や文脈に敏感な感情分析においてはDoc2Vecがより効果的であることが示唆されたが、TF-IDFは大規模で汎用的なデータセットにおいても競争力を持つことがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。