Skip to main content
QUICK REVIEW

[論文レビュー] Sentiment Analysis: A Survey

Rahul Tejwani|arXiv (Cornell University)|May 11, 2014
Sentiment Analysis and Opinion Mining参考文献 5被引用数 15
ひとこと要約

本調査は、製品レビュー やソーシャルメディアなどのユーザー生成コンテンツにおける意見の分類を目的とした自然言語処理手法に焦点を当て、感情分析技術の包括的概要を提供する。文書レベル、文レベル、特徴ベースの感情分類を、教師あり学習および教師なし学習、語彙的辞書、主観性検出を用いて検討し、最先端のシステムでは最大80%の正確性を達成している。

ABSTRACT

Sentiment analysis (also known as opinion mining) refers to the use of natural language processing, text analysis and computational linguistics to identify and extract subjective information in source materials. Mining opinions expressed in the user generated content is a challenging yet practically very useful problem. This survey would cover various approaches and methodology used in Sentiment Analysis and Opinion Mining in general. The focus would be on Internet text like, Product review, tweets and other social media.

研究の動機と目的

  • ユーザー生成コンテンツ、特にソーシャルメディアおよび電子商取引における感情分析手法の体系的レビューを提供すること。
  • 感情分析における主な課題、特に皮肉、否定、複数の意見を含む非公式なテキストにおける表現を特定すること。
  • 語彙的、機械学習、主観性分類のアプローチの有効性を、文書レベル、文レベル、特徴レベルの感情分類において検討すること。
  • ビジネスインテリジェンス、顧客フィードバック分析、ソーシャルメディア監視における感情分析の実用的応用を強調すること。
  • 既存研究の限界、特に英語および中国語を除く多言語対応の不足を評価すること。

提案手法

  • 感情分析を3段階で分類:文書レベル(全体の極性)、文レベル(個々の文の感情)、特徴ベース(特定の製品的要因に関する意見)。
  • 項目の頻度、品詞タグ、意見語、否定語などの特徴を用いて、ナイーブベイズ、サポートベクターマシン、マクシマムエントロピーなどの教師あり学習モデルを感情分類に適用。
  • ポイントワイズ相互情報量を用いた教師なし手法により、主観語を同定し、ラベルなしテキストから感情を抽出。
  • SentiWordNet 3.0、LIWC、General Inquirer などの語彙的リソースを活用して、語やフレーズに感情スコアを割り当てる。
  • 主観性分類を用いて、客観的な文をフィルタリングし、感情分析に適した意見を含むコンテンツに集中する。
  • トレーニングおよび評価に用いられるベンチマークデータセット(Cornell Movie Review Dataset、Multi-Domain Sentiment (MDS) Dataset、MPQA)を活用。

実験結果

リサーチクエスチョン

  • RQ1非公式で多様なテキストソースにおいて、文書レベル、文レベル、特徴ベースの感情分類を正確に行うにはどうすればよいか?
  • RQ2ユーザー生成コンテンツにおける感情分類に最も効果的な特徴と機械学習技術は何か?
  • RQ3否定、皮肉、複数意見を含む文などの課題が、感情分析のパフォーマンスにどのように影響を与えるか?
  • RQ4教師なしおよび語彙ベースの手法が、感情分析において教師ありモデルと同等の正確性を達成できる範囲はどの程度か?
  • RQ5ビジネスインテリジェンスおよびソーシャルメディア監視における感情分析の実用的応用と限界は何か?

主な発見

  • ナイーブベイズ、サポートベクターマシン、マクシマムエントロピーなどの教師あり学習手法は、標準的な感情分類データセットで最大80%の正確性を達成している。
  • SentiWordNet や LIWC を含む語彙的および辞書ベースのアプローチは強く、一部のアプローチがベンチマークデータセットで70%を超える正確性を達成している。
  • 主観性分類は、関係のない客観的コンテンツをフィルタリングするために不可欠であり、処理のオーバーヘッドを低減し、感情分析の効率を向上させる。
  • 特徴ベースの感情分類により、ノートパソコンの画面品質など、特定の製品的要因に関する意見の詳細な分析が可能になる。
  • 1ドメインあたり1000件のポジティブおよびネガティブレビューを含むMDSデータセットは、感情分析モデルのトレーニングおよびテストに広く用いられている。
  • 進展は見られるものの、皮肉、風刺、文脈依存の感情表現のため、感情分析は依然として困難であり、特にツイートのような短いテキストでは顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。