[論文レビュー] Performance Investigation of Feature Selection Methods
本稿では、2000ドキュメントの映画レビューコーパスを用いて、文書頻度、情報ゲイン、ゲインレシオ、カイ二乗、Relief-Fの5つの特徴選択手法を評価し、センチメント分類性能への影響を検討した。情報ゲインは一貫した結果を示したが、ゲインレシオが全体として最高のパフォーマンスを達成した。センチメントリソース(HM、GI、Opinion Lexicon)は低性能であり、最適な分類器性能は適切な代表的特徴数の選択に依存した。
Sentiment analysis or opinion mining has become an open research domain after proliferation of Internet and Web 2.0 social media. People express their attitudes and opinions on social media including blogs, discussion forums, tweets, etc. and, sentiment analysis concerns about detecting and extracting sentiment or opinion from online text. Sentiment based text classification is different from topical text classification since it involves discrimination based on expressed opinion on a topic. Feature selection is significant for sentiment analysis as the opinionated text may have high dimensions, which can adversely affect the performance of sentiment analysis classifier. This paper explores applicability of feature selection methods for sentiment analysis and investigates their performance for classification in term of recall, precision and accuracy. Five feature selection methods (Document Frequency, Information Gain, Gain Ratio, Chi Squared, and Relief-F) and three popular sentiment feature lexicons (HM, GI and Opinion Lexicon) are investigated on movie reviews corpus with a size of 2000 documents. The experimental results show that Information Gain gave consistent results and Gain Ratio performs overall best for sentimental feature selection while sentiment lexicons gave poor performance. Furthermore, we found that performance of the classifier depends on appropriate number of representative feature selected from text.
研究の動機と目的
- さまざまな特徴選択手法のセンチメント分類性能への効果を調査すること。
- 異なるセンチメントリソースが特徴選択および分類精度に与える影響を評価すること。
- センチメント分析における再現率、適合率、正答率を最大化するための最適な特徴数を特定すること。
- 実世界の映画レビューデータセット上でフィルターベース特徴選択手法の性能を比較すること。
提案手法
- 本研究では、文書頻度、情報ゲイン、ゲインレシオ、カイ二乗、Relief-Fの5つのフィルターベース特徴選択手法を適用した。
- TF-IDFベクトル化を用いて、2000ドキュメントの映画レビューコーパス上で特徴選択を実施した。
- 比較のため、3つのセンチメントリソース(HM、GI、Opinion Lexicon)を用いてセンチメント特徴を抽出した。
- 標準的な指標(適合率、再現率、正答率)を用いて、教師あり分類器を訓練および評価した。
- 最適な特徴数を特定するため、選択された特徴数を変化させた状態で各手法のパフォーマンスを評価した。
- 再現性を確保し、手法間の直接比較を可能にするために、固定されたデータセットを用いて実験を実施した。
実験結果
リサーチクエスチョン
- RQ1どの特徴選択手法がセンチメント分類において最高の適合率、再現率、正答率を達成するか?
- RQ2異なるセンチメントリソースを特徴選択に用いた場合、性能はどのように比較されるか?
- RQ3分類性能を最大化するための最適な特徴数は何か?
- RQ4情報ゲインやゲインレシオのようなフィルターベース手法は、他の手法と比較して一貫性および頑健性においてどのように異なるか?
主な発見
- 情報ゲインは、さまざまな特徴数において一貫したパフォーマンスを示し、センチメント特徴選択の信頼できる選択肢であった。
- ゲインレシオは、適合率、再現率、正答率の観点から全体として最高のパフォーマンスを達成し、他のすべての手法を上回った。
- 3つのセンチメントリソース(HM、GI、Opinion Lexicon)は低性能を示し、特徴選択に単独で用いる場合の有効性が限定的であることが示された。
- 分類器のパフォーマンスは、選択された特徴数に極めて敏感であり、最適なパフォーマンスは特定の、中程度の特徴数で達成された。
- カイ二乗およびRelief-Fは中程度のパフォーマンスを示したが、情報ゲインおよびゲインレシオに比べて効果が低かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。