Skip to main content
QUICK REVIEW

[論文レビュー] Stance and Sentiment in Tweets

Saif M. Mohammad, Parinaz Sobhani|arXiv (Cornell University)|May 5, 2016
Sentiment Analysis and Opinion Mining参考文献 54被引用数 10
ひとこと要約

この論文は、標的に対するスタンスとセンチメント極性の両方についてアノテートされた、最初のツイートデータセットを紹介し、それらの相互作用に関する最初の体系的分析を可能にする。n-gram、センチメントリソース、ワード埋め込みを用いたシンプルなスタンス検出システムを提案し、SemEval-2016共有タスクの19チーム中で最高の性能を示し、Fスコア70.3を達成した。

ABSTRACT

We can often detect from a person's utterances whether he/she is in favor of or against a given target entity -- their stance towards the target. However, a person may express the same stance towards a target by using negative or positive language. Here for the first time we present a dataset of tweet--target pairs annotated for both stance and sentiment. The targets may or may not be referred to in the tweets, and they may or may not be the target of opinion in the tweets. Partitions of this dataset were used as training and test sets in a SemEval-2016 shared task competition. We propose a simple stance detection system that outperforms submissions from all 19 teams that participated in the shared task. Additionally, access to both stance and sentiment annotations allows us to explore several research questions. We show that while knowing the sentiment expressed by a tweet is beneficial for stance classification, it alone is not sufficient. Finally, we use additional unlabeled data through distant supervision techniques and word embeddings to further improve stance classification.

研究の動機と目的

  • 標的に対するスタンスとセンチメント極性の両方についてアノテートされた、最初の大規模なツイートデータセットの作成。
  • 特に、意見が注目対象とは異なるエンティティを向いている場合に、ソーシャルメディアのテキストにおけるセンチメントとスタンスの関係を調査すること。
  • 標的が明示的に言及されていなくても、センチメントとワード埋め込みを活用した堅牢なスタンス検出システムの開発。
  • スタンス検出におけるセンチメント特徴の有効性を評価し、単にセンチメント予測に依存する限界を検証すること。
  • ラベルなしデータを用いた遠隔教師付き学習技術を活用し、スタンス分類の性能を向上させること。

提案手法

  • アテイズム、気候変動、フェミニスト運動、ヒラリー・クリントン、中絶の法的許可の5つの標的について、4,000件を超えるツイートを、スタンス(賛成、反対、中立)に対してアノテートした。
  • ツイートに含まれる意見が標的であるか、それとは別のエンティティを向いているかを追加でアノテートした。
  • 各ツイートに対して、センチメント極性(肯定的、否定的、中立的)を独立して割り当てた。
  • ワードおよび文字n-gram、センチメントリソース特徴、および遠隔教師付き学習によりラベルなしデータから得たワード埋め込みを用いた線形カーネルSVM分類器を訓練した。
  • 外部の知識源を活用し、大規模なラベルなしコーパス上で特徴学習を改善するために、遠隔教師付き学習を適用した。
  • アノテート済みデータセットから抽出したホールドアウトテストセットを用いて、SemEval-2016共有タスクベンチマークでシステムを評価した。

実験結果

リサーチクエスチョン

  • RQ1ツイート内で意見の標的がスタンスの標的と異なる場合、センチメントとスタンスはどのように相互作用するか?
  • RQ2センチメント予測のみに比べて、センチメント特徴がスタンス検出性能をどの程度向上させられるか?
  • RQ3ある標的についてラベル付きデータで学習したシステムが、同ドメイン内の他の標的へ一般化可能か?新たなアノテーションは不要か?
  • RQ4ワード埋め込みとセンチメントリソースを用いた遠隔教師付き学習は、スタンス分類の性能向上にどの程度効果的か?
  • RQ5テキストに明示的に言及されていない標的に対するスタンスを検出する際、人間の推論と自動システムとの間にはどの程度の性能格差が生じるか?

主な発見

  • 提案されたスタンス検出システムは、Fスコア70.3を達成し、SemEval-2016共有タスクに参加した19チーム中で最高の性能を示した。
  • ゴールドスタンダードのセンチメントと意見の標的アノテーションを入手したとしても、オラクルシステムはFスコア59.6%にとどまり、センチメント単体では正確なスタンス検出に不十分であることが示された。
  • センチメント特徴は、センチメント予測よりもスタンス検出においては効果が低いことが明らかになり、スタンス分類の独自の課題が浮き彫りになった。
  • 人間は、意見が別のエンティティを向いていても、標的に対するスタンスを推論できるが、自動システムはこのようなケースで著しく困難を示す。
  • ラベルなしデータからのワード埋め込みと遠隔教師付き学習技術の統合により、スタンス検出モデルの性能が顕著に向上した。
  • データセットは、多くのツイートが注目対象とは異なるエンティティを標的に意見を表明していることを明らかにし、現実のソーシャルメディアテキストにおけるスタンス検出の複雑さを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。