Skip to main content
QUICK REVIEW

[論文レビュー] Generating Word and Document Embeddings for Sentiment Analysis

Cem Rıfkı Aydın, Tunga Güngör|arXiv (Cornell University)|Jan 5, 2020
Sentiment Analysis and Opinion Mining被引用数 5
ひとこと要約

本稿では、文脈、教師あり、辞書ベースの特徴を統合することで、感情認識を備えた単語および文書埋め込みを生成する新規手法を提案する。この手法は、トルコ語および英語のデータセットにおいて、感情分類性能を顕著に向上させ、トルコ語映画レビューでは90%を超える正確性、英語のTwitterデータでは約88%の正確性を達成し、SVM分類器を用いて最先端の結果を実現した。

ABSTRACT

Sentiments of words differ from one corpus to another. Inducing general sentiment lexicons for languages and using them cannot, in general, produce meaningful results for different domains. In this paper, we combine contextual and supervised information with the general semantic representations of words occurring in the dictionary. Contexts of words help us capture the domain-specific information and supervised scores of words are indicative of the polarities of those words. When we combine supervised features of words with the features extracted from their dictionary definitions, we observe an increase in the success rates. We try out the combinations of contextual, supervised, and dictionary-based approaches, and generate original vectors. We also combine the word2vec approach with hand-crafted features. We induce domain-specific sentimental vectors for two corpora, which are the movie domain and the Twitter datasets in Turkish. When we thereafter generate document vectors and employ the support vector machines method utilising those vectors, our approaches perform better than the baseline studies for Turkish with a significant margin. We evaluated our models on two English corpora as well and these also outperformed the word2vec approach. It shows that our approaches are cross-domain and portable to other languages.

研究の動機と目的

  • 一般向け単語埋め込みが、トルコ語のような低資源言語におけるドメイン固有の感情極性を捉えることの限界を是正すること。
  • 教師あり感情スコアを、辞書および文脈からの意味的・語彙的特徴と統合することで、感情分類性能を向上させること。
  • ドメインおよび言語を問わず効果的な、ポータブルで多言語対応の単語および文書埋め込みを開発すること。
  • 従来の機械学習モデル(例:SVM)が、高品質な感情強化埋め込みと組み合わせることで、深層学習を上回ることを示すこと。
  • 感情認識埋め込みを他の自然言語処理タスク(感情分析にとどまらない)に応用可能な、公開可能なフレームワークを提供すること。

提案手法

  • 大規模コーパスで学習されたword2vec埋め込みに、レビュー単位の感情スコア(例:星評価)から得られる手作業特徴を組み合わせ、感情強化単語ベクトルを生成する。
  • 公式トルコ語辞書(TDK)からの辞書ベース特徴を統合し、語彙的知識を用いて意味的および文法的表現を豊かにする。
  • ドメイン固有の感情を最適化するために、教師あり感情スコア(肯定的、否定的、ニュートラル)と文脈的・辞書的特徴を、パラメータpを用いた重み付き統合戦略で統合する。
  • 強化された単語ベクトルの平均化またはプーリングにより文書レベルの埋め込みを構築し、文書レベルでも感情認識を保持する。
  • 感情分類にサポートベクターマシン(SVM)分類器を採用し、入力埋め込みの品質が高いため、この設定ではニューラルネットワークを上回った。
  • コサイン類似度を用いて単語ベクトルの意味的性質を定性的に評価し、感情極性が同じ単語が正しくクラスタリングされていることを確認した。

実験結果

リサーチクエスチョン

  • RQ1教師あり感情スコアと文脈的・辞書ベース特徴を統合することで、トルコ語のような低資源言語における感情分類のための単語埋め込みが向上するか?
  • RQ2ドメイン固有の感情情報の統合が、感情分析タスクにおける単語および文書埋め込みの性能にどのように影響するか?
  • RQ3感情強化埋め込みを供給された場合、SVMのような非ニューラル、従来の機械学習モデルがどの程度最先端の結果を達成できるか?
  • RQ4提案手法が、英語や映画レビュー、ソーシャルメディアなど多様なテキストタイプを含む、言語およびドメインを越えて一般化可能か?
  • RQ5感情認識埋め込みは、標準のword2vecや他のベースラインモデルと比較して、感情関連の意味的関係をどの程度正確に捉えられるか?

主な発見

  • 提案手法は、トルコ語映画レビューデータセットで90%を超える正確性を達成し、先行研究[11]のベースライン手法を顕著に上回った(p < 0.05で統計的有意性を示した)。
  • 英語のTwitterデータセットでは、約88%の正確性を達成し、遠隔教師あり学習や絵文字ベース特徴に依存する最先端モデルを上回った。
  • TDK辞書特徴と3特徴(教師あり)アプローチの組み合わせが、文脈が豊富な映画レビュー分野で最も高い性能向上をもたらした。
  • コーパスベースのアプローチ(共起パターンのみ、明示的な感情ラベルなし)でさえ、標準のword2vecを上回った。これは、文脈が感情を捉える上で価値があることを示している。
  • 定性的分析により、コサイン類似度を用いて、同じ極性の単語(例:'muhteşem' と '10/10'、'harika')が正しくグループ化されていることが確認された。
  • SVM分類器は一貫して畳み込みニューラルネットワーク(CNNs)を上回った。これは、高品質な埋め込みが、深層学習の複雑さの欠如を補っていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。