Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Sparse and Dense Feature Combinations for Sentiment Classification

Tao Yu, Christopher Hidey|arXiv (Cornell University)|Aug 13, 2017
Sentiment Analysis and Opinion Mining参考文献 11被引用数 5
ひとこと要約

この論文では、感情分析のための単純で強力なモデルを提案している。このモデルは、品詞(POS)タグごとにグループ化された密な単語埋め込みとスパースなn-gram特徴を組み合わせ、ロジスティック回帰分類器を用いる。この手法は、複数のベンチマークで準SOTA(最先端に近い)の性能を達成しており、複雑な深層学習モデルよりも多くのデータセットで優れた性能を発揮する一方で、高速で訓練が容易である。

ABSTRACT

Neural networks are one of the most popular approaches for many natural language processing tasks such as sentiment analysis. They often outperform traditional machine learning models and achieve the state-of-art results on most tasks. However, many existing deep learning models are complex, difficult to train and provide a limited improvement over simpler methods. We propose a simple, robust and powerful model for sentiment classification. This model outperforms many deep learning models and achieves comparable results to other deep learning models with complex architectures on sentiment analysis datasets. We publish the code online.

研究の動機と目的

  • 深層ニューラルネットワークの複雑さとトレーニング負荷を回避する、軽量で高性能な感情分類モデルの開発。
  • スパースなbag-of-words特徴と密な単語埋め込みを組み合わせることで、従来のNBSVMを上回る感情分類性能が得られるかどうかの調査。
  • 品詞(POS)タグごとに単語埋め込みをグループ化することによるモデル性能への影響の評価。
  • AdaSent や BLSTM-2DPooling といった複雑な深層学習アーキテクチャと比較して、精度とトレーニング効率の観点から提案手法の性能を評価すること。
  • 単純な線形モデルでありながら、複雑なアーキテクチャを必要とせず、実用的で容易にデプロイ可能なベースラインモデルを提供すること。

提案手法

  • モデルは、各クラスのn-gramの対数度数比を計算してスパースな特徴ベクトルを形成する、ナイーブベイズサポートベクターマシン(NBSVM)フレームワークを用いる。
  • 文内のすべての単語の単語埋め込みを平均化して密なベクトルを形成し、さらに品詞タグ(NOUN, VERB, ADJECTIVE)に応じて埋め込みをグループ化して追加の密なベクトルを生成する。
  • Twitter 感情分析データセット(TTwt)では、ターゲット単語用の追加の平均埋め込みベクトルを計算して、ターゲット依存の感情分類を可能にする。
  • ロジスティック回帰分類器への最終入力は、スパースなNBSVM特徴ベクトルと密な埋め込みベクトル(POSグループ化済みおよび平均埋め込みを含む)の連結である。
  • 事前学習済みのGoogle word2vec埋め込みが使用され、すべてのモデルはKim(2014)と同一の前処理手順を用いる。
  • スパースおよび密な特徴表現を組み合わせたものに対して、ロジスティック回帰を用いてモデルをトレーニングする。

実験結果

リサーチクエスチョン

  • RQ1スパースなn-gram特徴と密な単語埋め込みを組み合わせることで、標準的なNBSVMを上回る感情分類性能が得られるか?
  • RQ2品詞タグごとに単語埋め込みをグループ化することで、感情分類性能に顕著な向上が得られるか?
  • RQ3AdaSent や BLSTM-2DPooling といった複雑な深層学習アーキテクチャと比較して、提案手法の精度とトレーニング効率はどの程度か?
  • RQ4特徴工学的処理を施した単純な線形モデルが、より複雑なニューラルネットワークの性能を模倣または上回ることができるか?
  • RQ5感情分類タスクにおいて、単純な平均埋め込みと比較して、品詞タグ付き埋め込みを使用する利点はあるか?

主な発見

  • MRデータセットでは、NBLR + POSwembモデルが81.6%の精度を達成し、元のNBSVM(79.4%)を2.2ポイント上回った。
  • CRデータセットでは、モデルが84.0%の精度を達成し、NBSVM(81.8%)を2.2ポイント上回った。
  • MPQAデータセットでは、89.9%の精度を記録し、NBSVM(86.3%)を上回り、多数の複雑な深層学習モデルと同等またはそれを上回った。
  • IMDBデータセットでは、91.8%の精度を達成し、NBSVM(91.2%)を上回り、AdaSent(93.3%)に次いで2番目の性能を示した。
  • TTwtデータセットでは、マクロF1スコアが69.9%に達し、Targ-dept+(69.5%)やAdaRNN comb(65.9%)といった他のターゲット依存モデルを上回った。
  • モデルは複数のベンチマークで常に最良または2番目に優れた性能を示しており、埋め込みを用いた単純な特徴工学的処理が、複雑な深層学習モデルと同等の性能を発揮できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。