Skip to main content
QUICK REVIEW

[논문 리뷰] HateBR: A Large Expert Annotated Corpus of Brazilian Instagram Comments for Offensive Language and Hate Speech Detection

Francielle Vargas, Isabelle Carvalho|arXiv (Cornell University)|2021. 03. 27.
Hate Speech and Cyberbullying Detection인용 수 14
한 줄 요약

이 논문은 포르투갈어로 작성된 7,000개의 브라질리언 인스타그램 댓글로 구성된, 악성 언어 및 혐오 발언 탐지에 전용으로 설계된 최초의 대규모 전문가 주석 처리된 코퍼스인 HateBR를 소개한다. 세 단계의 주석 처리 방식—공격적인/비공격적인, 공격성 수준, 구체적인 혐오 발언 카테고리 9개—를 통해 HateBR는 기초 모델에서 최신 기술 수준의 F1 스코어 85%를 달성하며 기존의 포르투갈어 기반 기준 모델을 능가한다.

ABSTRACT

Due to the severity of the social media offensive and hateful comments in Brazil, and the lack of research in Portuguese, this paper provides the first large-scale expert annotated corpus of Brazilian Instagram comments for hate speech and offensive language detection. The HateBR corpus was collected from the comment section of Brazilian politicians' accounts on Instagram and manually annotated by specialists, reaching a high inter-annotator agreement. The corpus consists of 7,000 documents annotated according to three different layers: a binary classification (offensive versus non-offensive comments), offensiveness-level classification (highly, moderately, and slightly offensive), and nine hate speech groups (xenophobia, racism, homophobia, sexism, religious intolerance, partyism, apology for the dictatorship, antisemitism, and fatphobia). We also implemented baseline experiments for offensive language and hate speech detection and compared them with a literature baseline. Results show that the baseline experiments on our corpus outperform the current state-of-the-art for the Portuguese language.

연구 동기 및 목표

  • 브라질 포르투갈어에서 악성 언어 및 혐오 발언 탐지에 적합한 대규모 전문가 주석 처리 데이터셋의 부족 문제를 해결하기 위해.
  • 혐오 발언 및 공격적 콘텐츠의 맥락적·의미적 특성을 잘 반영할 수 있는 다층 주석 체계를 개발하기 위해.
  • NLP 모델의 학습 및 평가를 위한 고품질, 균형 잡힌, 다수 주석자 간 일致도가 확보된 코퍼스를 제공하기 위해.
  • 특히 정치적으로 민감한 맥락에서 브라질 소셜 미디어의 악성 언어 및 혐오 발언 탐지에 기준 기준을 설정하기 위해.
  • 구조화된 주석 체계가 뛰어난 모델 성능을 이끌 수 있음을 입증하고, 현재의 최신 기술 수준 결과를 초월하는 성능을 달성하기 위해.

제안 방법

  • HateBR 코퍼스는 정치적 갈등이 심한 브라질 정치인들의 인스타그램 계정 댓글 섹션에서 수집되었으며, 높은 정치적·사회적 긴장도를 지닌 콘텐츠로 선정되었다.
  • 세 단계 주석 체계를 적용하였다: (1) 양자 분류(공격적 vs. 비공격적), (2) 공격성 수준 분류(약간, 중간, 심각하게 공격적인), (3) 혐오 발언 유형 분류(9개 카테고리로 분류).
  • 언어학자, 혐오 발언 전문가, NLP 연구자로 구성된 전문가 팀이 철저한 지침과 훈련을 이행하여 주석을 수행하여 일관성과 편향 최소화를 확보하였다.
  • 주석자 간 일致도를 측정한 결과 높은 일致도를 기록하여 주석 체계의 신뢰성을 검증하였다.
  • 기초 모델은 단어 빈도 및 TF-IDF 특징을 사용하여 나이브 베이즈, 서포트 벡터 머신, 다층 퍼셉트론, 로지스틱 회귀 모델을 활용해 악성 언어 및 혐오 발언 탐지 작업에 대해 학습시켰다.
  • 혐오 발언 탐지 작업에서의 클래스 불균형 문제는 오버피팅 방지를 위해 언더샘플링을 적용하여 모델의 일반화 능력을 향상시켰다.

실험 결과

연구 질문

  • RQ1악성 언어 및 혐오 발언 탐지에 적합한 대규모 전문가 주석 처리 코퍼스를 브라질 포르투갈어라는 저자원 언어 분야에서 효과적으로 구축할 수 있는가?
  • RQ2공격성 수준과 특정 혐오 발언 카테고리까지 포함한 다층 주석 체계가 NLP 작업에서 데이터셋의 품질과 활용도를 향상시키는가?
  • RQ3주석 품질(주석자 간 일致도로 측정)이 혐오 발언 탐지의 후행 모델 성능과 어느 정도 상관관계를 가지는가?
  • RQ4이 코퍼스를 기반으로 학습된 기초 모델이 기존의 최신 기술 수준의 포르투갈어 기반 모델을 능가할 수 있는가?
  • RQ5크기, 균형, 주석 품질, 성능 기준에서 기존의 포르투갈어 코퍼스와 비교해 HateBR 코퍼스는 어떠한가?

주요 결과

  • HateBR 코퍼스는 총 7,000개의 인스타그램 댓글로 구성되어 있으며, 공격적 콘텐츠로 분류된 것이 3,500개, 비공격적 콘텐츠로 분류된 것이 3,500개로 균형 잡힌 클래스 분포를 확보하였다.
  • 높은 주석자 간 일致도 스코어를 기록하여 제안된 세 단계 주석 체계의 강건성과 일관성을 검증하였다.
  • 악성 언어 탐지 기초 모델은 F1 스코어 85%를 기록하여 기존의 최신 기술 수준의 포르투갈어 기반 모델을 뛰어넘는 성능을 보였다.
  • 혐오 발언 탐지 작업에서는 최고의 기초 모델이 F1 스코어 78%를 기록하여 클래스 불균형에도 불구하고 뛰어난 성능을 보였다.
  • 크기, 주석 품질, 모델 성능 측면에서 기존의 포르투갈어 기반 코퍼스를 뛰어넘으며, 언어 분야의 새로운 기준을 설정하였다.
  • 결과적으로, 체계적이고 전문가 주석 처리된 코퍼스가 단순한 기초 모델을 사용하더라도 뛰어난 모델 성능을 이끌 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.