Skip to main content
QUICK REVIEW

[論文レビュー] #MeTooMA: Multi-Aspect Annotations of Tweets Related to the MeToo Movement

Akash Kumar Gautam, Puneet Mathur|arXiv (Cornell University)|Dec 14, 2019
Hate Speech and Cyberbullying Detection被引用数 12
ひとこと要約

本稿では、MeToo運動に関連する9,973件のツイートを手動でアノテートした#MeTooMAというデータセットを紹介する。このデータセットは、関連性、立場、嫌がらせ発言、皮肉、対話行動(新規のカテゴリとして『告発』、『反論』、『正当化』を含む)の5つの言語的側面についてアノテートされている。高い相互アノテーター整合性(k-Alpha 0.79–0.93)を示しており、性的いじめに関する議論の多面的分析を可能にし、デジタル社会運動に関する計算言語学的、社会言語学的、心理言語学的研究を支援する。

ABSTRACT

In this paper, we present a dataset containing 9,973 tweets related to the MeToo movement that were manually annotated for five different linguistic aspects: relevance, stance, hate speech, sarcasm, and dialogue acts. We present a detailed account of the data collection and annotation processes. The annotations have a very high inter-annotator agreement (0.79 to 0.93 k-alpha) due to the domain expertise of the annotators and clear annotation instructions. We analyze the data in terms of geographical distribution, label correlations, and keywords. Lastly, we present some potential use cases of this dataset. We expect this dataset would be of great interest to psycholinguists, socio-linguists, and computational linguists to study the discursive space of digitally mobilized social movements on sensitive issues like sexual harassment.

研究の動機と目的

  • Twitter上でのMeToo運動を取り巻く複雑な言語的表現を捉える大規模かつ多面的なアノテート済みデータセットの作成。
  • ステーク、嫌がらせ発言、皮肉、対話行動といった複数の言語的次元を同時にアノテートするデータセットの不足に応えること。
  • 関連性、ステーク、嫌がらせ、皮肉、対話行動の各分野におけるマルチラベル分類タスクを可能にするために、計算言語学的研究を支援すること。
  • 言語的表現としての抑圧された声、力のダイナミクス、社会的政策の表現をオンライン運動においてどのように表現しているかを分析する社会言語学的および心理言語学的研究を促進すること。
  • 性的いじめに関するソーシャルメディア議論を分析するフェアで、説明可能で、責任ある(FAIR)システムの開発を支援する基盤を提供すること。

提案手法

  • MeToo運動の1周年記念に当たる2018年10月から12月にかけて、9,973件のMeToo関連ツイートを収集した。
  • 各ツイートを5つの言語的側面(関連性、立場、嫌がらせ発言、皮肉、対話行動)についてアノテートした。対話行動には、『告発』、『反論』、『正当化』という3つの新しいタイプを含む。
  • ドメイン専門のアノテーターが、詳細かつ標準化されたアノテーションガイドラインに従い、高い相互アノテーター整合性(k-Alpha 0.79–0.93)を確保した。
  • 各ツイートの発信国を示す地理的メタデータを統合し、国別比較分析を可能にした。
  • ラベルの相関、キーワード分布、地理的パターンの統計的分析を通じて、議論のあり方を特徴づけた。
  • 公開アクセスおよび今後の研究を目的として、DOI(10.7910/DVN/JN4EYU)を介してデータセットをリリースした。

実験結果

リサーチクエスチョン

  • RQ1性的いじめに関するオンライン議論において、ステーク、嫌がらせ発言、皮肉、対話行動といった異なる言語的要素は、どのように相互作用しているか?
  • RQ2MeToo関連の議論は地理的にどのように分布しており、国ごとにどのように異なるか?
  • RQ3MeToo運動関連のツイートにおいて、嫌がらせ発言、皮肉、ステークといったラベルは、どれほど相関しているか?
  • RQ4『告発』、『反論』、『正当化』といった新規の対話行動は、性的いじめに関する公共の議論にどのように現れているか?
  • RQ5このデータセットを用いることで、フェアで、説明可能で、責任ある(FAIR)計算システムを構築する上で、どのような意味を持つのか?

主な発見

  • 9,973件のツイートを含むデータセットは、高い相互アノテーター整合性(k-Alpha 0.79–0.93)を示しており、アノテーションの信頼性が高かった。
  • 関連研究では18,336件の発言について「嫌がらせ vs. 非嫌がらせ」のアノテーションがなされているが、#MeTooMAは9,973件のツイートに対して、5つの明確な言語的アノテーションを一括して提供する点で独自性を有する。
  • 『告発』、『反論』、『正当化』という3つの新しい対話行動の導入により、社会運動における議論のモデリングに新たなフレームワークが提供された。
  • 地理的分析から、MeToo議論における国別の参加の多様性が明らかになり、表現や関与の面で文化的な違いが存在することが示唆された。
  • ラベル相関分析から、ステークと嫌がらせ発言は独立ではなく、皮肉はしばしば否定的ステークや嫌がらせ内容と同時に現れる傾向があることが分かった。
  • 本データセットにより、皮肉が嫌がらせ発言の認識にどのように影響するか、あるいは正当化が告発の反論にどのように使われるかといった、多面的かつ包括的な研究が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。