Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study on Sentiment Classification of Chinese Review using Word Embedding

Yiou Lin, Hang Lei|arXiv (Cornell University)|Nov 5, 2015
Sentiment Analysis and Opinion Mining参考文献 31被引用数 21
ひとこと要約

本論文は、100万件のホテルレビューから得た単語埋め込みを用いた中国語センチメント分類に関する実証的研究を提案する。SVM、ロジスティック回帰、CNN、アンサンブル手法といった複数のモデルを評価し、上位の分類器を統合したスタックドアンサンブルモデル(LR_all)がF1スコア0.920を達成し、ナイーブベイズおよびマクシマムエントロピーのような従来のn-gramモデルを上回ることを示している。

ABSTRACT

In this article, how word embeddings can be used as features in Chinese sentiment classification is presented. Firstly, a Chinese opinion corpus is built with a million comments from hotel review websites. Then the word embeddings which represent each comment are used as input in different machine learning methods for sentiment classification, including SVM, Logistic Regression, Convolutional Neural Network (CNN) and ensemble methods. These methods get better performance compared with N-gram models using Naive Bayes (NB) and Maximum Entropy (ME). Finally, a combination of machine learning methods is proposed which presents an outstanding performance in precision, recall and F1 score. After selecting the most useful methods to construct the combinational model and testing over the corpus, the final F1 score is 0.920.

研究の動機と目的

  • 単語埋め込みを中国語センチメント分類の特徴量として用いる有効性を調査すること。
  • 従来のn-gramモデル(ナイーブベイズ、マクシマムエントロピー)と、単語埋め込みを用いたディープラーニングおよび機械学習モデルを比較すること。
  • 複数の分類器を統合したアンサンブルモデルを構築し、中国語レビューのセンチメント分析における性能を向上させること。
  • 中国語センチメント分類において安定した性能を発揮するための最小データサイズを特定すること。
  • 低リソースNLPシナリオにおけるモデルアーキテクチャおよび特徴表現のセンチメント分類精度への影響を調査すること。

提案手法

  • 100万件のホテルレビューから成る大規模な中国語意見コーパス、MioChnCorpを、オンラインレビューWebサイトから構築した。
  • 60次元のベクトルを用いて、中国語レビュー分野における語の密な表現(単語埋め込み)をWord2vecで学習した。
  • SVM、ロジスティック回帰、CNN、アンサンブル手法といった複数の機械学習モデルを、単語埋め込みを入力特徴量として用いて学習した。
  • 複数のベースモデル(ME、SVC、LinearSVC、RF、CNN)の予測をスタックし、WekaのCfsSubsetEvalおよびBestFirst探索を用いて特徴選択を実施することで、アンサンブルモデル(LR_all)を構築した。
  • 最終的なモデルでは、10-fold交差検証および属性評価を用いて、最も情報量の多いサブモデルの予測をロジスティック回帰で統合した。
  • 性能評価は、60,000件、80,000件、120,000件の訓練データサイズを想定し、精度、再現率、F1スコアを用いて行った。

実験結果

リサーチクエスチョン

  • RQ1大規模な中国語レビューコーパスで学習された単語埋め込みは、センチメント分類に適した意味的特徴を効果的に表現できるか?
  • RQ2単語埋め込みを用いた機械学習モデルは、中国語センチメント分析において、ナイーブベイズおよびマクシマムエントロピーのような従来のn-gramモデルと比較して性能に優れているか?
  • RQ3F1スコアを最大化する目的で、アンサンブルフレームワークにおける最適なモデルの組み合わせは何か?
  • RQ4トレーニングデータサイズが、中国語レビューにおける単語埋め込みベースのセンチメント分類器の性能に与える影響は何か?
  • RQ5他のNLPタスクで成功を収めたにもかかわらず、なぜCNNはSVMやアンサンブルモデルに比べて性能が劣るのか?

主な発見

  • ME、SVC、LinearSVC、RF、CNNの予測を統合したアンサンブルモデルLR_allは、120,000件のテストデータセットで最高のF1スコア0.920を達成した。
  • SVM(特に線形カーネルを用いたLinearSVCおよびSVC)は、全データサイズにおいて一貫して他のモデルを上回り、個々の性能で最高を記録した。
  • センチメントリソースを併用せずとも、単語埋め込みそのものが強力な結果をもたらしたため、感情関連の意味的・構文的パターンを効果的に捉えられると示された。
  • CNNはナイーブベイズおよびマクシマムエントロピーを上回ったが、SVMやアンサンブルモデルに比べて性能が劣り、訓練データが不足していることや、タスクに最適でないアーキテクチャであることが原因と考えられる。
  • 訓練データが増えるにつれて性能が向上し、約60,000件のデータで安定化し、120,000件のデータで最適な結果が得られた。
  • 属性選択により、ME、SVC、LinearSVC、RF、CNNが最も価値のあるモデルと特定された。性能が劣るモデル(例:Vote_all)を除外することで、汎化性能と効率性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。