Skip to main content
QUICK REVIEW

[論文レビュー] Text-based Sentiment Analysis and Music Emotion Recognition

Erion Çano|arXiv (Cornell University)|Jun 6, 2018
Advanced Text Analysis Techniques被引用数 8
ひとこと要約

本博士論文は、多様なテキストデータセットで最先端の性能を達成するため、多スケールの単語、バイグラム、トライグラム畳み込みと領域的最大プーリングを組み合わせた最適化された畳み込みニューラルネットワークを活用した、テキストベースのセンチメント分析および音楽感情認識のためのディープラーニングフレームワークを提案する。本手法は、データ不足、単語埋め込みの選定、可変長テキスト向けのアーキテクチャ設計という課題に対処する。

ABSTRACT

Sentiment polarity of tweets, blog posts or product reviews has become highly attractive and is utilized in recommender systems, market predictions, business intelligence and more. Deep learning techniques are becoming top performers on analyzing such texts. There are however several problems that need to be solved for efficient use of deep neural networks on text mining and text polarity analysis. First, deep neural networks need to be fed with data sets that are big in size as well as properly labeled. Second, there are various uncertainties regarding the use of word embedding vectors: should they be generated from the same data set that is used to train the model or it is better to source them from big and popular collections? Third, to simplify model creation it is convenient to have generic neural network architectures that are effective and can adapt to various texts, encapsulating much of design complexity. This thesis addresses the above problems to provide methodological and practical insights for utilizing neural networks on sentiment analysis of texts and achieving state of the art results. Regarding the first problem, the effectiveness of various crowdsourcing alternatives is explored and two medium-sized and emotion-labeled song data sets are created utilizing social tags. To address the second problem, a series of experiments with large text collections of various contents and domains were conducted, trying word embeddings of various parameters. Regarding the third problem, a series of experiments involving convolution and max-pooling neural layers were conducted. Combining convolutions of words, bigrams, and trigrams with regional max-pooling layers in a couple of stacks produced the best results. The derived architecture achieves competitive performance on sentiment polarity analysis of movie, business and product reviews.

研究の動機と目的

  • センチメント分析におけるディープラーニングの課題としてのデータ不足に対処するため、クラウドソーシングを活用して感情ラベル付きの楽曲データセットを構築する。
  • 小規模なデータセットにおいて特に有効な、ドメイン特化型か一般向けの事前学習済みコレクションからの単語埋め込みの最適な供給戦略を調査する。
  • 手動によるカーネルおよびプーリング設定のチューニングが不要な、汎用的かつ効果的なニューラルネットワークアーキテクチャを設計する。
  • 運転中の運転行動と感情的な音楽プロファイルを一致させることで、運転の快適性を向上させる文脈に配慮した音楽レコメンデーションシステムを開発する。
  • 分類性能の向上を図るため、ディープラーニングと従来のNLP特徴量、アンサンブル手法を統合するためのメソドロジカルな知見を提供する。

提案手法

  • 音楽感情認識におけるデータ不足を解消するため、ソーシャルメディアのタグを活用して2つの中規模の感情ラベル付き楽曲データセットを構築した。
  • さまざまなテキストコレクションで学習された単語埋め込みの性能を評価し、学習データのサイズとドメインが埋め込み品質に与える影響を特定した。
  • 単語、バイグラム、トライグラム用のフィルタを備えたスタックド畳み込みニューラルネットワークを設計し、階層的な意味的パターンを捉えるために領域的最大プーリング層を追加した。
  • 映画レビュー、製品レビュー、ビジネスレビューの各データセットで体系的な実験を実施し、最適なフィルタおよびプーリング設定を同定した。
  • 最高性能を示したモデルを統合し、ユーザーの運転行動を感情的音楽プロファイルにマッピングする文脈に配慮した音楽レコメンデーションシステムを構築した。
  • 文書セグメントに再帰的ネットワークを適用するなど、単語埋め込みと従来の特徴量を組み合わせるアンサンブル戦略を検討し、精度の向上を図った。

実験結果

リサーチクエスチョン

  • RQ1クラウドソーシングによるソーシャルメディアタグは、音楽センチメント分析のための中規模で感情ラベル付きデータセットを構築するのにどの程度有効か?
  • RQ2特に訓練データが限られた状況下で、単語埋め込みの性能は、学習コーパスのサイズとドメインに依存するか?
  • RQ3多様なテキストタイプと長さのセンチメント分類において、畳み込み層とプーリング層の最適な組み合わせは何か?
  • RQ4さまざまなテキスト入力に対して、顕著なハイパーパramータチューニングを要せず、競争力のある性能を達成できる汎用的なディープラーニングアーキテクチャは可能か?
  • RQ5特徴量レベルまたは意思決定レベルのアンサンブル手法を用いることで、センチメントおよび感情認識におけるディープラーニングモデルの性能はどのように向上するか?

主な発見

  • 大規模で一般向けのコーパスで学習された単語埋め込みは、小規模でドメイン特化型のデータセットで学習されたものよりも、特にラベル付きデータが不足している状況で優れた性能を示した。
  • ユニグラム、バイグラム、トライグラム用のフィルタを備えたスタックドCNNアーキテクチャに加え、領域的最大プーリングを組み合わせたアーキテクチャが、複数のセンチメント分析ベンチマークで最高の分類精度を達成した。
  • 提案されたアーキテクチャは、映画レビュー、製品レビュー、ビジネスレビューなど多様なテキストタイプにわたり、タスク固有の再設定を要せず、良好な一般化性能を示した。
  • 単語埋め込みと従来のテキスト特徴量(例:TF-IDF)を組み合わせる、または文書セグメントに再帰的ネットワークを適用した予測結果と統合することで、モデルの精度がさらに向上した。
  • 文脈に配慮した音楽レコメンデーションシステムは、運転行動を感情的音楽プロファイルにマッピングすることに成功し、運転の快適性と安全性の向上を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。