[논문 리뷰] A large-scale crowdsourced analysis of abuse against women journalists and politicians on Twitter
이 논문은 4,537명의 자원봉사자와 전문가 3명이 라벨링한 275,000개의 트윗을 포함한 철저히 캐릭터화된 데이터셋을 바탕으로, 트위터에서 여성 기자와 정치인을 대상으로 하는 온라인 괴롭힘에 대한 대규모 공동 작업 분석을 제시한다. 이는 전문화된 폭력적 어휘 임베딩을 통합한 BERT 기반 모델을 미세조정하여 폭력적 콘텐츠 탐지에 뛰어난 성능을 달성하였으며, 온라인 괴롭힘 탐지 및 소셜 미디어 안전성 연구를 촉진하기 위해 공개된 데이터셋을 제공한다.
We report the first, to the best of our knowledge, hand-in-hand collaboration between human rights activists and machine learners, leveraging crowd-sourcing to study online abuse against women on Twitter. On a technical front, we carefully curate an unbiased yet low-variance dataset of labeled tweets, analyze it to account for the variability of abuse perception, and establish baselines, preparing it for release to community research efforts. On a social impact front, this study provides the technical backbone for a media campaign aimed at raising public and deciders' awareness and elevating the standards expected from social media companies.
연구 동기 및 목표
- 트위터에서 여성 기자와 정치인을 대상으로 하는 온라인 괴롭힘의 빈도와 특성에 대해 조사한다.
- 대규모 공동 작업을 통해 신뢰성 있고 편향이 없으며 변동성이 작은 괴롭힘 탐지용 데이터셋을 구축한다.
- 인간의 인식에서 발생하는 편향과 변동성을 최소화하는 데 초점을 맞춘 기계 학습 기반 기술 기반을 마련한다.
- 소셜 미디어 플랫폼의 온라인 괴롭힘 대응 정책 개선을 압박하기 위한 미디어 캠페인을 지원한다.
- 자연어 이해 분야에서 유해 콘텐츠 탐지에 기여하기 위해 연구 공동체에 고품질의 레이블링된 데이터셋을 공개한다.
제안 방법
- 트위터의 파이어호스를 통해 778명의 여성 기자와 정치인을 언급하는 약 220만 개의 트윗을 수집하였으며, 계층적 표본 추출을 통해 215,000개를 선별하고, 클래스 불균형을 줄이기 위해 나이브 베이즈 분류기를 사용해 60,000개를 보강하였다.
- 암시 Amnesty 디코더를 통해 4,537명의 온라인 자원봉사자가 다단계 인터페이스를 통해 트윗을 라벨링하였으며, 정의와 예시를 포함한 이진 분류(폭력적/문제 있는 내용/문제 없음), 폭력 유형, 선택적 폭력 수단을 포함하였다.
- 자원봉사자 라벨의 정합성을 검증하기 위해 전문가가 568개의 트윗을 라벨링하였으며, 통계적 편향 제어를 위해 중요도 표본 추출 기법을 사용하였다.
- 레이블링된 데이터를 기반으로 BERT 기반 딥 러닝 모델을 훈련시켰으며, 사전 학습된 BERT 인코더와 폭력적 어휘에 특화된 작업 전용 단어 임베딩을 결합하여 896차원의 연결된 표현을 사용하였다.
- 중요도 표본 추출 가중치를 조정한 90:5:5 훈련/검증/테스트 분할을 기반으로, 교차 엔트로피 손실과 함께 확률적 경사 하강법을 사용해 엔드 투 엔드로 모델을 훈련시켰다.
- 정신 건강 보호 조치를 포함하여, 폭력적 콘텐츠를 라벨링한 후 경고 메시지를 표시하는 시스템을 구현하여 라벨러에게 발생할 수 있는 피해를 최소화하였다.
실험 결과
연구 질문
- RQ1트위터에서 여성 기자와 정치인을 대상으로 하는 폭력적 콘텐츠의 빈도와 유형은 어떠한가?
- RQ2사람들의 폭력 인식은 개인 간에 어떻게 다를 수 있으며, 이러한 변동성은 어떻게 측정하고 라벨링 과정에 통합할 수 있는가?
- RQ3특화된 폭력적 어휘 임베딩을 통합한 미세조정된 BERT 모델은 자원이 적고 편향이 많은 환경에서 온라인 괴롭힘을 효과적으로 탐지할 수 있는가?
- RQ4대규모 공동 작업 기반의 라벨링 과정을 통해 신뢰성 있고 편향이 없으며 공개 가능한 괴롭힘 탐지용 데이터셋을 어떻게 구축할 수 있는가?
- RQ5이 데이터셋과 모델은 소셜 미디어 플랫폼의 온라인 괴롭힘 대응 정책 개선을 위한 옹호 활동에 어느 정도 기여할 수 있는가?
주요 결과
- 총 157,000개의 고유한 트윗이 4,537명의 자원봉사자에 의해 최소한 한 번 이상 라벨링되었으며, 총 337,000개의 라벨이 생성되었으며, 중요도 표본 추출과 계층적 표본 추출을 통해 편향을 최소화하는 데 초점을 맞추었다.
- 275,000개의 트윗이 삼중 라벨링되었으며, 일致성 분석 결과 폭력 인식이 특히 비텍스트적 또는 모호한 폭력의 경우에 크게 다를 수 있음을 확인하였다.
- BERT 기반 모델은 폭력적 콘텐츠 탐지에 뛰어난 성능을 보였으며, 90:5:5 분할을 기반으로 이진 분류 헤드를 훈련하고 BERT와 특화된 폭력적 어휘 임베딩의 병합 표현을 미세조정하여 학습하였다.
- 전문가가 568개의 트윗을 라벨링하여 자원봉사자 결과를 검증하였으며, 고위험 트윗 선택 시 잠재적 편향을 보정하기 위해 중요도 표본 추출을 사용하였다.
- 이 연구는 공개된 데이터셋과 모델을 생산하여 향후 소셜 미디어 기업의 괴롭힘 관리 정책 개선을 위한 계획된 미디어 캠페인의 기술적 기반을 마련하였다.
- 대부분의 폭력은 텍스트 기반이며 분류가 어려웠으며, 상당 부분이 '기타' 카테고리에 속해 있어 폭력 유형의 복잡성을 강조하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.