Skip to main content
QUICK REVIEW

[논문 리뷰] K-MHaS: A Multi-label Hate Speech Detection Dataset in Korean Online News Comment

Jean Lee, Taejun Lim|arXiv (Cornell University)|2022. 08. 23.
Hate Speech and Cyberbullying Detection인용 수 10
한 줄 요약

K-MHaS는 8개의 세분화된 카테고리에 걸쳐 1~4개의 겹치는 레이블을 가진 109,692개의 한국어 뉴스 댓글로 구성된 대규모 다중 레이블 혐오 발언 데이터셋으로, 혐오 발언 내에서의 상호작용과 주관성을 모델링할 수 있도록 한다. 서브-자소리 수준 토크나이저를 갖춘 KR-BERT 모델은 최신 기술 성능을 달성하여 한글 음절을 분해하는 것이 혐오 발언 변형 탐지에 유리함을 입증한다.

ABSTRACT

Online hate speech detection has become an important issue due to the growth of online content, but resources in languages other than English are extremely limited. We introduce K-MHaS, a new multi-label dataset for hate speech detection that effectively handles Korean language patterns. The dataset consists of 109k utterances from news comments and provides a multi-label classification using 1 to 4 labels, and handles subjectivity and intersectionality. We evaluate strong baseline experiments on K-MHaS using Korean-BERT-based language models with six different metrics. KR-BERT with a sub-character tokenizer outperforms others, recognizing decomposed characters in each hate speech class.

연구 동기 및 목표

  • 다국어 혐오 발언 데이터셋의 부족을 해결하기 위해 언어적 뉘앙스와 상호작용을 반영하는 대규모 다중 레이블 한국어 데이터셋을 구축하는 것.
  • 인종, 성별, 정치, 낭만어 등 다양한 차원에서 겹치는 레이블을 지원함으로써 한국어에서의 강력한 혐오 발언 탐지 기반을 마련하는 것.
  • 실제 댓글 환경을 반영한 현실적이고 복잡한 한국어 혐오 발언 탐지 벤치마크에서 최신 기술 기반의 사전 훈련된 언어 모델의 성능을 평가하는 것.

제안 방법

  • 2018년 1월부터 2020년 6월까지 수집된 109,692개의 한국어 온라인 뉴스 댓글에서 데이터셋을 구성하였으며, 낮은 품질이나 짧은 발언을 정규화 및 필터링하여 전처리를 수행하였다.
  • 이중 레이블링 체계를 적용: (1) 이진 분류(혐오 발언 대비 비혐오 발언), (2) 정치, 성별, 종교, 낭만어 등 8개 카테고리에 대한 세분화된 다중 레이블 분류.
  • 각 샘플에 1~4개의 레이블을 지원하는 다중 레이블 분류를 통해 현실적인 주관성과 겹치는 혐오 발언 속성의 상호작용을 반영한다.
  • KoELECTRA, KoBERT, Multi-BERT, KR-BERT 등 사전 훈련된 언어 모델을 K-MHaS에서 미세조정하였으며, 한국어 형태소 감지 능력을 향상시키기 위해 한글 음절을 그래프램으로 분해하는 서브-자소리 수준 토크나이저를 사용하였다.
  • 평가에는 F1-_macro, F1-micro, F1-weighted, 정확한 매칭, AUC, 하미ング 손실의 6개 표준 다중 레이블 지표를 사용하여 성능 비교를 포괄적으로 수행하였다.
  • KR-BERT의 서브-자소리 수준 토크나이저는 초기 소리, 모음, 종성(예: ㅋ, ㅗ, ㄹ)으로 음절을 분해함으로써 한국어 형태소 문법 복잡성을 효과적으로 처리하도록 특별히 설계되었으며, 슬랭 및 형태소 변형 탐지 능력을 향상시켰다.

실험 결과

연구 질문

  • RQ1기존의 사전 훈련된 언어 모델이 겹치는 정체성과 상호작용을 포함한 다중 레이블 혐오 발언 탐지에서 얼마나 효과적인가?
  • RQ2표준 문자 또는 단어 수준 토크나이징 대비 서브-자소리 수준 토크나이징이 한국어 텍스트에서 혐오 발언 탐지 성능을 얼마나 향상시키는가?
  • RQ3사전 훈련 데이터 분포의 선택(예: 위키백과 대비 현대 온라인 코퍼스)이 실제 혐오 발언 탐지 작업에서 모델 일반화 및 성능에 어떤 영향을 미치는가?
  • RQ4대규모 한국어 혐오 발언 데이터셋에서의 레이블 분포와 레이블 간 상관관계는 어떻게 구성되어 있으며, 이는 모델 학습과 평가에 어떤 영향을 미치는가?

주요 결과

  • KoELECTRA는 모든 6개 평가 지표에서 최고의 성능을 기록하여, 특히 나무위키 및 모두와 같은 현대 온라인 코퍼스 포함 여부가 모델의 강건성에 크게 기여함을 시사한다.
  • KR-BERT는 서브-자소리 토크나이저를 사용하여 10개 레이블 조합 중 6개에서 모든 모델을 앞서며, 특히 '기원 & 성별'과 같은 상호작용적 혐오 발언 탐지에서 마이크로-F1 0.9494를 기록하여 뛰어난 성능을 보였다.
  • 서브-자소리 토크나이저 덕분에 KR-BERT는 복잡한 한국어 음절을 의미 있는 하위 구성요소(예: ㅋ, ㅗ, ㄹ)로 분해하여, 알려진 형태에서 약간 벗어난 형태의 혐오 발언 변형도 탐지할 수 있었다.
  • 단일 레이블 분류에서 KR-BERT-c(문자 수준)와 KoELECTRA는 각각 F1-micro 점수 0.8553과 0.8490을 기록하여 데이터와의 강한 도메인 일치성을 보였다.
  • Multi-BERT(다국어)와 한국어 전용 모델인 KoELECTRA 및 KR-BERT 간의 성능 격차는 최적의 혐오 발언 탐지에 있어 언어 특화 사전 훈련의 중요성을 강조한다.
  • 레이블 조 분석 결과, '정치 & 낭만어'와 '성별 & 연령'과 같은 상호작용적 카테고리는 F1-micro 점수 0.20~0.30 사이로 매우 도전적인 것으로 나타나, 복잡하고 겹치는 정체성의 모델링 향상 여전히 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.