Skip to main content
QUICK REVIEW

[논문 리뷰] Developing a Multilingual Annotated Corpus of Misogyny and Aggression

Shiladitya Bhattacharya, Siddharth Singh|arXiv (Cornell University)|2020. 03. 16.
Hate Speech and Cyberbullying Detection참고 문헌 34인용 수 61
한 줄 요약

이 논문은 YouTube 댓글에서 수집된 인도 영어, 힌디어, 인도 방글라어의 여성혐오와 공격성에 대한 다국어 주석 말뭉치를 제시하며, 두 수준(공격성 및 여성혐오)으로 주석화했다. 데이터 수집, 주석 태그집합, 도전 과제, 그리고 세 언어에 걸친 기본 분류기 실험을 다룬다.

ABSTRACT

In this paper, we discuss the development of a multilingual annotated corpus of misogyny and aggression in Indian English, Hindi, and Indian Bangla as part of a project on studying and automatically identifying misogyny and communalism on social media (the ComMA Project). The dataset is collected from comments on YouTube videos and currently contains a total of over 20,000 comments. The comments are annotated at two levels - aggression (overtly aggressive, covertly aggressive, and non-aggressive) and misogyny (gendered and non-gendered). We describe the process of data collection, the tagset used for annotation, and issues and challenges faced during the process of annotation. Finally, we discuss the results of the baseline experiments conducted to develop a classifier for misogyny in the three languages.

연구 동기 및 목표

  • 인도 언어에서 소셜 미디어의 여성혐오와 공동체주의를 연구하기 위한 다국어 말뭉치 생성을 촉진한다.
  • 세 언어에 걸친 YouTube 댓글로부터의 데이터 수집을 설명한다.
  • 공격성(공개적, 은밀한, 비공격적) 및 여성혐오(성별 기반, 비성별 기반)에 대한 주석 태그집합을 정의한다.
  • 주석 과정의 도전과제와 가이드라인을 논의한다.
  • 세 언어에서 여성혐오 탐지에 대한 기본 분류 결과를 제시한다.

제안 방법

  • 인도 영어, 힌디어, 인도 방글라어를 사용하는 YouTube 비디오의 댓글을 수집한다.
  • 두 수준으로 댓글에 주석을 다는 것: 공격성(공개적으로, 은밀하게, 비공격적) 및 여성혐오(성별 기반, 비성별 기반).
  • 주석자들이 사용하는 태그셋과 주석 지침을 설명한다.
  • 데이터 수집 워크플로, 품질 관리 및 주석자 간 합의 고려사항을 논의한다.
  • 세 언어에 걸친 여성혐오 탐지를 위한 기본 분류기를 학습하고 보고한다.

실험 결과

연구 질문

  • RQ1인도 소셜 미디어에서 여성혐오와 공격성을 연구하기 위해 다국어 주석 말뭉치를 어떻게 구축할 수 있는가?
  • RQ2인도 영어, 힌디, 인도 방글라어에서 공격성과 여성혐오를 포착하기 위한 효과적인 주석 체계는 무엇인가?
  • RQ3이 말뭉치를 이용해 세 언어에서 여성혐오 분류의 기본 성능은 얼마나 달성될 수 있는가?
  • RQ4이 도메인에 대한 다국어 소셜 미디어 데이터를 수집하고 주석하는 데 어떤 도전이 발생하는가?

주요 결과

  • 이 데이터셋은 세 언어에 걸쳐 공격성과 여성혐오에 대해 주석된 20,000개가 넘는 댓글로 구성되어 있다.
  • 공격성은 공개적, 은밀한, 또는 비공격적으로 분류되며; 여성혐오는 성별 기반 또는 비성별 기반으로 분류된다.
  • 기본 실험이 세 언어에서 여성혐오 분류기를 개발하기 위해 수행되었다.
  • 본 논문은 코퍼스 품질에 영향을 미치는 데이터 수집, 태그셋 설계 및 주석 도전과제에 대해 논의한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.