[論文レビュー] Sentiment Analysis of Yelp Reviews: A Comparison of Techniques and Models
本研究では、トロントの5,000軒のレストランを対象に、362,554件のYelpレビューにおける感情分析のためのテキスト前処理および機械学習/ディープラーニングモデルの評価を実施。マクロF1スコアを指標として用いたところ、事前学習済み埋め込みとシーケンス長の上限設定により性能が向上するものの、BERT や LSTM などの複雑なモデルよりも、ロジスティック回帰やSVM といったシンプルなモデルが優れた性能を示した。
We use over 350,000 Yelp reviews on 5,000 restaurants to perform an ablation study on text preprocessing techniques. We also compare the effectiveness of several machine learning and deep learning models on predicting user sentiment (negative, neutral, or positive). For machine learning models, we find that using binary bag-of-word representation, adding bi-grams, imposing minimum frequency constraints and normalizing texts have positive effects on model performance. For deep learning models, we find that using pre-trained word embeddings and capping maximum length often boost model performance. Finally, using macro F1 score as our comparison metric, we find simpler models such as Logistic Regression and Support Vector Machine to be more effective at predicting sentiments than more complex models such as Gradient Boosting, LSTM and BERT.
研究の動機と目的
- 感情分析における効果的なテキスト前処理およびモデル選択戦略を実務家が選択できるように支援すること。
- ストップワード除去、正規化、n-gramの追加といったさまざまなテキスト前処理技術がモデル性能に与える影響を評価すること。
- 伝統的な機械学習モデル(例:ロジスティック回帰、SVM)とディープラーニングモデル(例:LSTM、BERT)がYelpレビューの感情を予測する際の有効性を比較すること。
- 多クラス感情分類において、モデルの複雑さ、性能、解釈可能性のトレードオフを評価すること。
- ディープラーニングモデルにおけるハイパーパrameter選択(例:シーケンス長の上限、語彙サイズ)に関する実証的知見を提供すること。
提案手法
- 個々の前処理技術を評価するため、マルチノミアル・ナイーブベイズベースラインを用いたアブレーションスタディ。
- 前処理済みYelpレビューを用いて、ロジスティック回帰、SVM、勾配ブースティング、LSTM、BERT の複数のモデルを訓練・比較。
- 機械学習モデルの性能向上を目的に、バイナリーバッグオブワーズにビグラムを追加し、最小頻度制約を適用し、テキスト正規化を実施。
- ディープラーニングモデルの汎化性能を向上させるために、事前学習済みGloVe埋め込みを採用し、最大シーケンス長を200トークンに制限。
- 過学習を軽減するため、LSTMアーキテクチャに早期停止法とドロップアウト層を適用。
- クラス不均衡に対処するため、マクロF1スコア(各クラスのF1スコアの無重み平均)を用いて全モデルを評価。
実験結果
リサーチクエスチョン
- RQ1ストップワード除去や正規化などの異なるテキスト前処理技術が、感情分類性能にどのように影響するか?
- RQ2Yelpレビュー感情分類において、ロジスティック回帰、SVM、勾配ブースティングのうち、どの機械学習モデルが最も優れた性能を示すか?
- RQ3LSTM や BERT といったディープラーニングモデルは、マクロF1スコアおよび学習効率の観点から、伝統的なモデルに比べてどのように異なるか?
- RQ4シーケンス長の上限や語彙サイズといったハイパーパrameter選択が、ディープラーニングモデルの性能を最も顕著に向上させるか?
- RQ5モデルの複雑さと性能には相関があるか、それとも解釈可能性が高く優れたシンプルなモデルが複雑なモデルを上回るのか?
主な発見
- ロジスティック回帰やサポートベクターマシンといったシンプルなモデルが、勾配ブースティング、LSTM、BERT といったより複雑なモデルよりも高いマクロF1スコアを達成した。
- テキスト正規化、最小頻度制約、ビグラム特徴の追加が、伝統的な機械学習モデルの性能向上に寄与した。
- ディープラーニングモデルでは、事前学習済みGloVe埋め込みの使用と、シーケンス長を200トークンに制限することで、汎化性能が著しく向上し、過学習が軽減された。
- 語彙サイズを5,000語に制限することで、事前学習済み埋め込みを用いた際の性能が向上したが、より大きな語彙サイズでは結果が悪化した。
- LSTMモデルは、ポジティブな感情を正しく分類する率が低く(34%がニュートラルに誤分類)、主にレビューの長さが短く、シーケンス長の制限による影響が大きかった。
- 計算コストが高かったにもかかわらず、BERT や LSTM モデルはマクロF1スコアにおいてシンプルなモデルを上回らず、解釈不能な性質のため、LIME などの追加ツールによる分析が不可欠となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。