Skip to main content
QUICK REVIEW

[논문 리뷰] #MeTooMA: Multi-Aspect Annotations of Tweets Related to the MeToo Movement

Akash Kumar Gautam, Puneet Mathur|arXiv (Cornell University)|2019. 12. 14.
Hate Speech and Cyberbullying Detection인용 수 12
한 줄 요약

이 논문은 MeToo 운동과 관련된 9,973개의 트위터 게시물로 구성된 #MeTooMA 데이터셋을 소개한다. 이 데이터셋은 관련성, 입장, 혐오 발언, 풍자, 대화 행위(신규 카테고리인 고발, 반박, 정당화 포함)의 다섯 가지 언어적 측면에 대해 수작업으로 주석 처리되었다. 높은 상호 평가자 간 일致성(k-alpha 0.79–0.93)을 보이며, 성추행 논의에 대한 다각도 분석을 가능하게 하여 디지털 사회운동에 대한 계산적, 사회언어학적, 심리언어학적 연구를 지원한다.

ABSTRACT

In this paper, we present a dataset containing 9,973 tweets related to the MeToo movement that were manually annotated for five different linguistic aspects: relevance, stance, hate speech, sarcasm, and dialogue acts. We present a detailed account of the data collection and annotation processes. The annotations have a very high inter-annotator agreement (0.79 to 0.93 k-alpha) due to the domain expertise of the annotators and clear annotation instructions. We analyze the data in terms of geographical distribution, label correlations, and keywords. Lastly, we present some potential use cases of this dataset. We expect this dataset would be of great interest to psycholinguists, socio-linguists, and computational linguists to study the discursive space of digitally mobilized social movements on sensitive issues like sexual harassment.

연구 동기 및 목표

  • 트위터에서 MeToo 운동 둘레의 복잡한 언어적 표현을 포괄하는 대규모 다각도 주석 처리 데이터셋을 구축하기 위해.
  • 민감한 소셜미디어 논의에서 입장, 혐오 발언, 풍자, 대화 행위 등의 다중 언어적 차원을 동시에 주석 처리한 데이터셋의 부족을 보완하기 위해.
  • 관련성, 입장, 혐오, 풍자, 대화 행위의 다중 레이블 분류 작업을 가능하게 하여 계산 언어학 연구를 지원하기 위해.
  • 소수자 목소리, 권력 관계, 사회 정책이 온라인 운동에서 어떻게 표현되는지에 대한 사회언어학적 및 심리언어학적 연구를 촉진하기 위해.
  • 성추행과 관련된 소셜미디어 논의를 분석하기 위한 공정하고 책임감 있고 해석 가능하며 책임 있는(FAIR) 시스템을 향한 향후 도전 과제의 기초를 제공하기 위해.

제안 방법

  • MeToo 운동의 1주년을 맞아 2018년 10월부터 12월까지 9,973개의 MeToo 관련 트윗을 수집하였다.
  • 관련성, 입장, 혐오 발언, 풍자, 대화 행위(신규 대화 행위 유형 3종: 고발, 반박, 정당화 포함)의 다섯 가지 언어적 측면에 대해 각 트윗을 주석 처리하였다.
  • 높은 상호 평가자 간 일치도(k-alpha 0.79–0.93)를 확보하기 위해 전문가 주석자와 상세하고 표준화된 주석 가이드라인을 활용하였다.
  • 각 트윗의 출처 국가를 나타내는 지리적 메타데이터를 통합하여 다국가 비교 분석을 가능하게 하였다.
  • 레이블 상관관계, 키워드 분포, 지리적 패턴을 분석하여 논의 환경을 특성화하였다.
  • 공개 접근과 향후 연구를 위해 DOI(10.7910/DVN/JN4EYU)를 통해 데이터셋을 배포하였다.

실험 결과

연구 질문

  • RQ1성추행에 관한 온라인 논의에서 입장, 혐오 발언, 풍자, 대화 행위 등의 다양한 언어적 구성요소가 어떻게 상호작용하는가?
  • RQ2MeToo 관련 논의의 지리적 분포는 어떻게 되며, 국가 간에 어떻게 다를 수 있는가?
  • RQ3MeToo 운동 관련 트윗에서 혐오 발언, 풍자, 입장 등의 레이블이 서로 얼마나 상관이 있는가?
  • RQ4고발, 반박, 정당화와 같은 새로운 대화 행위가 성폭력에 관한 대중 논의에서 어떻게 나타나는가?
  • RQ5이 데이터셋을 사용할 경우, 민감한 소셜미디어 논의 분석을 위한 공정하고 책임감 있고 해석 가능하며 책임 있는(FAIR) 계산 시스템 개발에 어떤 함의가 있는가?

주요 결과

  • 9,973개의 트윗을 포함하는 데이터셋은 높은 상호 평가자 간 일치도(k-alpha 범위 0.79–0.93)를 보이며, 주석 처리의 강력한 신뢰성을 나타낸다.
  • 관련 연구에서 18,336개의 게시물이 폭력 여부에 대해 주석 처리되었지만, #MeTooMA는 9,973개의 트윗에 대해 단일으로 총정리된 5개의 독립된 언어적 주석을 제공한다는 점에서 유일하다.
  • 고발, 반박, 정당화와 같은 세 가지 신규 대화 행위의 포함은 사회운동에서의 논의 모델링을 위한 새로운 프레임워크를 제공한다.
  • 지리적 분석을 통해 MeToo 논의에 다양한 국가에서의 참여가 이루어졌음을 확인하였으며, 표현 방식과 참여 방식의 다문화적 다양성이 존재함을 시사한다.
  • 레이블 상관관계 분석 결과, 입장과 혐오 발언은 상관이 없으며, 풍자는 종종 부정적 입장이나 폭력적 내용과 함께 나타난다.
  • 이 데이터셋은 다각도 연구를 가능하게 하며, 예를 들어 풍자가 혐오 발언의 인식에 어떤 영향을 미치는지 또는 정당화가 고발 반박에 어떻게 사용되는지 등을 연구할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.