Skip to main content
QUICK REVIEW

[論文レビュー] Developing a Multilingual Annotated Corpus of Misogyny and Aggression

Shiladitya Bhattacharya, Siddharth Singh|arXiv (Cornell University)|Mar 16, 2020
Hate Speech and Cyberbullying Detection参考文献 34被引用数 61
ひとこと要約

この論文は、インド英語、ヒンディー語、インド・バングラ語のYouTubeコメントから収集された女性蔑視と攻撃性の多言語注釈コーパスを提示し、2つのレベル(攻撃性と女性蔑視)で注釈したものである。データ収集、注釈タグセット、課題、3言語にわたるベースライン分類器の実験を扱う。

ABSTRACT

In this paper, we discuss the development of a multilingual annotated corpus of misogyny and aggression in Indian English, Hindi, and Indian Bangla as part of a project on studying and automatically identifying misogyny and communalism on social media (the ComMA Project). The dataset is collected from comments on YouTube videos and currently contains a total of over 20,000 comments. The comments are annotated at two levels - aggression (overtly aggressive, covertly aggressive, and non-aggressive) and misogyny (gendered and non-gendered). We describe the process of data collection, the tagset used for annotation, and issues and challenges faced during the process of annotation. Finally, we discuss the results of the baseline experiments conducted to develop a classifier for misogyny in the three languages.

研究の動機と目的

  • インドの言語でのソーシャルメディアにおける女性蔑視と共同体主義を研究するための多言語コーパスの作成を動機づける。
  • 3言語にまたがるYouTubeコメントからのデータ収集を説明する。
  • 攻撃性(顕在的、潜在的、非攻撃的)および女性蔑視(性別関連、非性別関連)の注釈タグセットを定義する。
  • 注釈プロセスにおける課題とガイドラインについて議論する。
  • 3言語での女性蔑視検出のベースライン分類結果を提供する。

提案手法

  • インド英語、ヒンディー語、インド・バングラ語のYouTube動画からコメントを収集する。
  • コメントを2つのレベルで注釈する:攻撃性(顕在的に、潜在的に、非攻撃的)と女性蔑視(性別関連、非性別関連)。
  • 注釈者が用いたタグセットと注釈ガイドラインを説明する。
  • データ収集ワークフロー、品質管理、そして注釈者間の一致度の考慮事項について議論する。
  • 3言語にわたる女性蔑視検出のベースライン分類器を訓練し、報告する。

実験結果

リサーチクエスチョン

  • RQ1インドのソーシャルメディアにおける女性蔑視と攻撃性を研究するために、どのように多言語の注釈付きコーパスを構築できるか。
  • RQ2インド英語、ヒンディー語、インド・バングラ語で攻撃性と女性蔑視を捉えるのに有効な注釈スキームは何か。
  • RQ3このコーパスを用いて3言語の女性蔑視分類でどのようなベースラインの性能が達成できるか。
  • RQ4この領域の多言語ソーシャルメディアデータを収集・注釈する際にどんな課題が生じるか。

主な発見

  • データセットは、3言語にわたって攻撃性と女性蔑視の注釈を付けられた20,000件を超えるコメントで構成される。
  • 攻撃性は公然、潜在、または非攻撃的に分類され、女性蔑視は性別関連または非性別関連に分類される。
  • ベースライン実験が、3言語での女性蔑視検出の分類器を開発するために実施された。
  • 本論文はデータ収集、タグセット設計、およびコーパス品質に影響を与える注釈の課題について論じている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。