Skip to main content
QUICK REVIEW

[論文レビュー] $ ho$-hot Lexicon Embedding-based Two-level LSTM for Sentiment Analysis

Ou Wu, Tao Yang|arXiv (Cornell University)|Mar 21, 2018
Sentiment Analysis and Opinion Mining参考文献 22被引用数 3
ひとこと要約

本稿では、ノイズが多いまたは曖昧なラベルが与えられた状況下でも中国語の感情分析を向上させるために、ρホット埋め込みを用いた二段階LSTMモデルを提案する。二段階のラベル付け戦略(純粋な感情と混合感情のテキストを分離)と、極性語、品詞(POS)、接続詞といった語彙的手がかりをρホット符号化によって統合することで、3つの中国語感情分析データセットにおいて最先端の精度を達成し、従来のディープラーニングおよび語彙ベースの手法を上回った。

ABSTRACT

Sentiment analysis is a key component in various text mining applications. Numerous sentiment classification techniques, including conventional and deep learning-based methods, have been proposed in the literature. In most existing methods, a high-quality training set is assumed to be given. Nevertheless, constructing a high-quality training set that consists of highly accurate labels is challenging in real applications. This difficulty stems from the fact that text samples usually contain complex sentiment representations, and their annotation is subjective. We address this challenge in this study by leveraging a new labeling strategy and utilizing a two-level long short-term memory network to construct a sentiment classifier. Lexical cues are useful for sentiment analysis, and they have been utilized in conventional studies. For example, polar and privative words play important roles in sentiment analysis. A new encoding strategy, that is, $ ho$-hot encoding, is proposed to alleviate the drawbacks of one-hot encoding and thus effectively incorporate useful lexical cues. We compile three Chinese data sets on the basis of our label strategy and proposed methodology. Experiments on the three data sets demonstrate that the proposed method outperforms state-of-the-art algorithms.

研究の動機と目的

  • 感情ラベル付けが主観的かつ複雑であるため、感情分析のための高品質な訓練データを構築する課題に対処すること。
  • 極性語、品詞(POS)、接続詞といった語彙的手がかりを活用することで、感情分類のパフォーマンスを向上させること。
  • 純粋な感情と混合感情のテキストを分離する新しい二段階ラベル付け戦略を開発し、より効果的なモデル訓練を可能にすること。
  • 一対のホット符号化の代替手段として、語彙的特徴をより優れた方法で捉えるためにρホット符号化を導入すること。
  • 純粋な感情と混合感情の2つの異なるラベル付きデータ分布から同時に学習する二段階LSTMアーキテクチャを設計し、表現力と分類性能を向上させること。

提案手法

  • 二段階ラベル付け戦略を導入:まず、大規模なテキスト群に対して1つのラベル(純粋な感情方向)をアノテーターが付与。次に、複数のアノテーターが混合感情テキストの小規模なセットをラベル付けすることで曖昧性を捉える。
  • 階層的な感情表現をモデル化するための二段階LSTMネットワークを提案:第一段階は純粋な感情のシーケンスを符号化し、第二段階は混合感情の文脈を統合する。
  • 語彙埋め込みを用いてモデルに言語的知識を注入し、極性語、品詞タグ、接続語をトレーニング可能な特徴として符号化する。
  • 一対のホット符号化の代替手段として、ρホット符号化を導入。これにより、複数の関連語(例:感情の手がかり)を重み付きの寄与を伴って同時に符号化できる。
  • 異なる語彙的手がかり(極性語、POS、接続語)にそれぞれ別々の埋め込み層を設け、それらを連結して二段階LSTMに供給し、統合的な表現学習を実現する。
  • ネットワークはクロスエントロピー損失を用いてエンドツーエンドで訓練され、ρとρホット符号化のnといったハイパーパrameterはグリッドサーチにより最適化される。

実験結果

リサーチクエスチョン

  • RQ1純粋な感情と混合感情のテキストを分離する二段階ラベル付け戦略が、感情分類のための訓練データの質と有用性を向上させることができるか?
  • RQ2語彙的手がかり(極性語、POS、接続語)を語彙埋め込みを介して統合することで、ディープラーニングモデルの感情分析パフォーマンスが向上するか?
  • RQ3ρホット符号化が、従来の1対のホット符号化に比べて、テキスト内の意味的および感情関連特徴をより効果的に捉えることができるか?
  • RQ4二段階LSTMアーキテクチャが、純粋な感情と混合感情の2つの異なるデータ分布から階層的な感情表現を効果的に学習できるか?
  • RQ5異なる構成要素(例:極性語、POS、接続語)が最終的な分類精度にどの程度寄与しているか?

主な発見

  • 提案されたρTl-LSTMモデルは、3つの中国語感情分析データセットすべてで最高の精度を達成し、最先端の手法を上回った。
  • 語彙埋め込みにすべての極性語を用いることで、極性語を一切使わないモデルと比較して最大4.7%の精度向上が達成され、ホテルデータセットでは最高で0.837の精度を記録した。
  • 語彙埋め込みに品詞(POS)の手がかりを組み込むことで、POSを含まないモデルと比較して最大1.5%の性能向上が得られ、ホテルコーパスでは最高で0.837の結果となった。
  • 接続語の埋め込みを追加することでさらに精度が向上し、モバイルコーパスではすべての接続語を用いた場合に最高で0.841の性能を達成した。
  • ρTl-LSTM-Wモデルはモバイルデータセットで最高の精度0.841を達成した一方、ρTl-LSTM-Cはホテルデータセットで0.837を記録し、複数のデータセットにわたって一貫した優位性を示した。
  • ρホット符号化の最適なρ値は5〜10であった。ホテルデータセットではρ=5で最高の精度0.837が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。