Skip to main content
QUICK REVIEW

[論文レビュー] Semi-supervised emotion lexicon expansion with label propagation and specialized word embeddings

Mario Giulianelli|arXiv (Cornell University)|Aug 13, 2017
Sentiment Analysis and Opinion Mining参考文献 35被引用数 4
ひとこと要約

本稿では、感情固有の単語埋め込みと新しいラベル伝播アルゴリズムを用いて、半教師あり手法による感情リソースの拡張を提案する。Hashtag Emotion Corpus を用いて双方向LSTMを訓練し、感情に特化した単語ベクトルを学習し、意味的類似性グラフを構築し、バッチ最適化ラベル伝播を適用することで、NRC 感情リソースを拡張し、ベースラインモデルと比較して平均で10.5% F1スコアを向上させた。

ABSTRACT

There exist two main approaches to automatically extract affective orientation: lexicon-based and corpus-based. In this work, we argue that these two methods are compatible and show that combining them can improve the accuracy of emotion classifiers. In particular, we introduce a novel variant of the Label Propagation algorithm that is tailored to distributed word representations, we apply batch gradient descent to accelerate the optimization of label propagation and to make the optimization feasible for large graphs, and we propose a reproducible method for emotion lexicon expansion. We conclude that label propagation can expand an emotion lexicon in a meaningful way and that the expanded emotion lexicon can be leveraged to improve the accuracy of an emotion classifier.

研究の動機と目的

  • 感情語彙のカバー範囲が限定されているため、既存の感情リソースの再帰率が低いという問題に対処する。
  • 文脈的・感情的特徴を反映した単語表現を用いて、リソースを拡張することで、感情分類の性能を向上させる。
  • 教師あり学習とグラフベースラベル伝播を組み合わせたスケーラブルな半教師ありフレームワークを構築する。
  • 大規模グラフにおけるラベル伝播の最適化を、バッチ勾配降下法を用いて行い、メモリ使用量と計算コストを低減する。
  • 感情固有の単語埋め込みが、リソース拡張および下流の感情分類の両方において性能向上をもたらすことを示す。

提案手法

  • Hashtag Emotion Corpus (Mohammad & Kiritchenko, 2015) を用いて双方向LSTMを訓練し、感情の方向性を専用のベクトル次元に符号化する感情固有の単語埋め込みを学習する。
  • 感情固有の単語埋め込み間のコサイン類似度を用いて意味的類似性グラフを構築し、語彙的関係を表現する。
  • コサイン類似度を距離指標として用いるラベル伝播の新規バリエーションを提案し、独自の重み計算関数を導入する。
  • 大規模グラフ上で効率的に学習を実行するため、ラベル伝播にバッチベースの学習戦略を導入する。
  • ラベル伝播アルゴリズムを用いて、シードリソース(NRC 感情リソース)の感情ラベルをグラフ内の未ラベル語に伝播する。
  • 拡張されたリソースとラベル伝播によるクラス確率分布を用いて、下流の感情分類器をファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1感情固有の単語埋め込みは、感情リソース拡張のための意味的類似性グラフの品質を向上させることができるか?
  • RQ2バッチ最適化ラベル伝播アルゴリズムは、大規模グラフ上でスケーラブルかつ効率的な半教師ありリソース拡張を可能にするか?
  • RQ3専用埋め込みとラベル伝播を統合することで、ベースラインモデルと比較して感情分類性能がどの程度向上するか?
  • RQ4同じ感情分類タスクにおいて、提案手法の性能は人間アノテーターと比較してどの程度か?
  • RQ5提案フレームワークはドメインを越えて一般化可能であり、正確性を損なわずにリソースカバレッジの再帰率を向上させることができるか?

主な発見

  • 拡張されたリソースを用いた双方向LSTMを用いた本手法は、Hashtag Emotion Corpus において平均56.2%のF1スコアを達成し、リソース拡張なしのベースラインLSTMと比較して10.5%の向上を示した。
  • 人間アノテーターは平均40.6%のF1スコアにとどまり、モデルの性能が人間の性能よりもはるかに上限に近い水準に達していることを示しており、モデルが人間の直感を超える微細な感情的ニュアンスを捉えている可能性を示唆している。
  • バッチ最適化ラベル伝播アルゴリズムにより、トレーニング時間とメモリ消費量が削減され、数万ノードの規模の大規模グラフに対してもスケーラブルに適用可能となった。
  • 感情固有の単語埋め込みを用いることで、より意味的意味のある類似性グラフが得られ、下流の感情分類タスクにおけるF1スコアの向上が確認された。
  • 分散表現の文脈において、コサイン類似度に基づく重みを用いたラベル伝播は、従来のユークリッド距離に基づくアプローチを上回る性能を示した。
  • 拡張されたリソースにより、特に初期性能が低かった低リソース感情(嫌悪・恐怖)に対して、感情分類器の一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。