Skip to main content
QUICK REVIEW

[論文レビュー] RETUYT in TASS 2017: Sentiment Analysis for Spanish Tweets using SVM and CNN

Aiala Rosá, Luis Chiruzzo|arXiv (Cornell University)|Oct 17, 2017
Sentiment Analysis and Opinion Mining被引用数 7
ひとこと要約

本論文は、手作業で作成された特徴量と単語埋め込みを用いたSVMと、単語埋め込みを用いたCNNを組み合わせたハイブリッドセンチメント分析システムを提案し、TASS 2017共有タスクで優れたパフォーマンスを達成した。両アプローチの組み合わせにより、複数の評価セットで改善された結果が得られ、低リソース言語におけるセンチメント分析において、従来の機械学習とディープラーニングを統合する有効性が示された。

ABSTRACT

This article presents classifiers based on SVM and Convolutional Neural Networks (CNN) for the TASS 2017 challenge on tweets sentiment analysis. The classifier with the best performance in general uses a combination of SVM and CNN. The use of word embeddings was particularly useful for improving the classifiers performance.

研究の動機と目的

  • 既存の手法が限界を示すスペイン語ツイートにおける低リソースセンチメント分析の課題に対処すること。
  • ソーシャルメディアにおけるセンチメント分類において、従来の機械学習(SVM)とディープラーニング(CNN)を組み合わせることの有効性を調査すること。
  • スペイン語におけるセンチメント分類の精度に与える単語埋め込みと語彙的リソースの影響を評価すること。
  • スペイン語のツイートにおける非公式でノイズが多く、主観的な性質を効果的に処理できる堅牢なシステムの開発を目的とすること。

提案手法

  • 本システムは2つの独立したアプローチを用いた:手作業で作成された特徴量(単語埋め込み、主題性語彙、n-gram特徴)を用いて訓練されたサポートベクターマシン(SVM)分類器。
  • 畳み込みニューラルネットワーク(CNN)は、事前学習済みの単語埋め込みを入力として用い、元のツイートシーケンスを直接処理した。
  • SVMモデルは、主題性語彙との一致、否定の処理、n-gramパターンを含む特徴を統合し、文法的・意味的ヒントを捉えた。
  • CNNモデルは、固定長の単語埋め込みシーケンスを処理し、畳み込み層で局所的特徴を抽出し、プーリングで次元を削減した。
  • SVMとCNNモデルの確率的出力を統合するハイブリッドアンサンブル手法を適用し、全体の分類パフォーマンスを向上させた。
  • 単語埋め込みは、大規模なニュースコーパスを用いてword2vecで生成され、GloVeとfastTextと比較されたが、前者が優れたパフォーマンスを示したため採用された。

実験結果

リサーチクエスチョン

  • RQ1手作業で作成された特徴量を用いたSVMと、単語埋め込みを用いたCNNを組み合わせたハイブリッドアプローチは、スペイン語ツイートのセンチメント分類においてどの程度有効であるか?
  • RQ2事前学習済みの単語埋め込みは、低リソースのソーシャルメディアテキストにおけるセンチメント分類パフォーマンスをどの程度向上させるか?
  • RQ3語彙的リソースとニューラルネットワークモデルの組み合わせは、スペイン語ツイートのセンチメント分類において個々のモデルを上回る性能を発揮できるか?
  • RQ4スペイン語センチメント分類において、異なる種類の単語埋め込み(word2vec、GloVe、fastText)の性能はどのように比較されるか?

主な発見

  • 主題性語彙とn-gramパターンを含む手作業特徴量を用いたSVMベースのシステムは、言語学的事前知識の価値を示す競争力のあるパフォーマンスを達成した。
  • word2vec埋め込みを用いて訓練されたCNNモデルは、強いパフォーマンスを示し、ディープラーニングモデルがノイズの多いツイッター・テキストにおいてもセンチメント関連のパターンを効果的に捉えられることを示した。
  • SVMとCNNの出力を確率的統合によって融合したハイブリッドモデルは、すべての評価セットで最高の結果を達成し、個々のモデルを上回った。
  • 変形形を含む修正済みのインターセクションベースの主題性語彙を用いることで、カバー範囲とパフォーマンスが向上した。
  • GloVe埋め込みはword2vecに比べてパフォーマンスが低く、スペイン語ドメインにおける語彙カバレッジが低いためと推測される。
  • 最終的なシステムは、TASS 2017共有タスクで最先端の結果を達成し、スペイン語センチメント分析において、従来の手法とディープラーニング技術を統合する有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。