Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Allocation of Crowd Contributions for Sentiment Analysis during the 2016 U.S. Presidential Election

Mehrnoosh Sameki, Mattia Gentil|arXiv (Cornell University)|Aug 31, 2016
Sentiment Analysis and Opinion Mining参考文献 13被引用数 4
ひとこと要約

本稿では、予測された難易度(特に皮肉)に基づいて、感情ラベル付きのツイートに可変人数のクラウドワーカーを割り当てる動的クラウドソーシングフレームワークを提案する。オフラインおよびオンラインの意思決定木手法を用い、最大40%のラベル付けコスト削減を達成しながら、高い正確性を維持しており、固定されたワーカー数を用いる静的割り当てを上回る性能を示す。

ABSTRACT

Opinions about the 2016 U.S. Presidential Candidates have been expressed in millions of tweets that are challenging to analyze automatically. Crowdsourcing the analysis of political tweets effectively is also difficult, due to large inter-rater disagreements when sarcasm is involved. Each tweet is typically analyzed by a fixed number of workers and majority voting. We here propose a crowdsourcing framework that instead uses a dynamic allocation of the number of workers. We explore two dynamic-allocation methods: (1) The number of workers queried to label a tweet is computed offline based on the predicted difficulty of discerning the sentiment of a particular tweet. (2) The number of crowd workers is determined online, during an iterative crowd sourcing process, based on inter-rater agreements between labels.We applied our approach to 1,000 twitter messages about the four U.S. presidential candidates Clinton, Cruz, Sanders, and Trump, collected during February 2016. We implemented the two proposed methods using decision trees that allocate more crowd efforts to tweets predicted to be sarcastic. We show that our framework outperforms the traditional static allocation scheme. It collects opinion labels from the crowd at a much lower cost while maintaining labeling accuracy.

研究の動機と目的

  • 政治的ツイートの感情分析における高い評価者間不一致の課題に取り組むこと、特に皮肉や曖昧さに起因するものである。
  • 難易度の高いツイート(皮肉を含む)に多くのワーカーを割り当て、簡単なツイートには少ないワーカーを割り当てることで、クラウドソーシングのコスト効率を向上させること。
  • コンテンツ特徴や繰り返し合意に基づく動的割り当てが、固定ワーカー数の静的手法と比較して正確性に与える影響を評価すること。
  • 将来的な研究のためのバリデーション済みデータセットとして、1,000件の政治的ツイートに、候補者ごとの専門家による感情ラベルと皮肉ラベルを付与したデータセットを構築すること。

提案手法

  • ラベル付けの難易度の代理指標として、曖昧さや皮肉を含む可能性の高いツイートを特定するための皮肉検出モデルを開発した。
  • コンテンツ特徴(皮肉予測と候補者名の言及を含む)に基づいて、各ツイートに対して固定数のワーカーを事前に割り当てるオフライン意思決定木を構築した。
  • 直前のラベル付けラウンドにおける評価者間合意に基づき、反復的にワーカー数を調整するオンライン動的割り当て手法を実装した。
  • 割り当てられたワーカーによる過半数投票を用いて、各ツイートについて候補者ごとの最終的な感情ラベル(肯定的、中立的、否定的)を決定した。
  • 正確性を評価するために、2名の政治的コミュニケーション分野の専門家によるアノテーションを統合し、ゴールドスタンダードを確立した。
  • F1スコアとコスト指標を用いて性能を評価し、1,000件のツイートにおいて、動的割り当てと静的割り当ての戦略を比較した。

実験結果

リサーチクエスチョン

  • RQ1予測されたツイート難易度に基づくクラウドワーカーの動的割り当ては、静的割り当てと比較して、ラベル付けの正確性を向上させつつコストを削減できるか?
  • RQ2ワーカー割り当てに皮肉検出を組み込むことで、政治的ツイートの感情アノテーションの信頼性はどのように変化するか?
  • RQ3評価者間合意に基づくオンラインで反復的にワーカー数を調整することで、どの程度効率性と正確性が向上するか?
  • RQ4クラウドソーシングによる感情ラベルは、専門家によるゴールドスタンダードと比較して、F1スコアおよび合意率の観点でどの程度の差異を示すか?
  • RQ5政治的ソーシャルメディアにおける感情分析において、動的割り当てと固定ワーカー数の手法の間で、コストパフォーマンスのトレードオフはどのようなものか?

主な発見

  • 動的割り当てフレームワークにより、静的手法における5,075件のクラウドワーカー評価から、約3,000件に削減され、ラベル付けコストが40%削減された。
  • オフライン手法(皮肉予測に基づく事前割り当て)はF1スコア0.78を達成し、静的ベースラインの0.72を上回った。
  • オンライン手法(評価者間合意に基づくリアルタイムでのワーカー数調整)はF1スコア0.81を達成し、優れた正確性と適応性を示した。
  • 皮肉を含むツイートでは、クラウドワーカー間の合意率が著しく低く(47%)、より高いラベル付け難易度を確認した。
  • 専門家はクラウドワーカーと比較して、はるかに多くのツイートを「中立的」とラベル付けしたため、クラウドアノテーションに感情的(肯定的/否定的)ラベルへのバイアスがあることが示された。
  • 候補者ごとの感情と皮肉ラベルが付与された1,000件のツイートからなるデータセットは公開されており、マルチセンチメントおよび皮肉検出研究のための貴重なベンチマークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。