Skip to main content
QUICK REVIEW

[논문 리뷰] Sexism detection: The first corpus in Algerian dialect with a code-switching in Arabic/ French and English

Imane Guellil, Ahsan Adeel|arXiv (Cornell University)|2021. 04. 03.
Hate Speech and Cyberbullying Detection참고 문헌 55인용 수 7
한 줄 요약

이 논문은 아랍어, 프랑스어, 영어로의 코드 스위칭을 포함한 알제리 다리자어에서 여성에 대한 성차별을 타겟으로 삼는, 공개적으로 이용 가능한 첫 번째 혐오 발언 코퍼스를 소개한다. 5,000개의 유튜브 댓글이 분석자가 라벨링하여, 균형 잡힌 코퍼스 1,798개와 균형 잡히지 않은 코퍼스 3,798개를 확보하였다. 특히 컨볼루션 신경망(CNN)을 포함한 딥러닝 모델이 균형 잡히지 않은 코퍼스에서 F1 스코어 86%를 기록하여, LSTM 및 Bi-LSTM 모델보다 뛰어난 성능을 보였다.

ABSTRACT

In this paper, an approach for hate speech detection against women in Arabic community on social media (e.g. Youtube) is proposed. In the literature, similar works have been presented for other languages such as English. However, to the best of our knowledge, not much work has been conducted in the Arabic language. A new hate speech corpus (Arabic\_fr\_en) is developed using three different annotators. For corpus validation, three different machine learning algorithms are used, including deep Convolutional Neural Network (CNN), long short-term memory (LSTM) network and Bi-directional LSTM (Bi-LSTM) network. Simulation results demonstrate the best performance of the CNN model, which achieved F1-score up to 86\% for the unbalanced corpus as compared to LSTM and Bi-LSTM.

연구 동기 및 목표

  • 아랍어, 특히 코드 스위칭이 포함된 알제리 다리자어에서 혐오 발언 탐지에 대한 레이블링된 데이터셋 부족 문제를 해결하기 위해.
  • 유튜브와 같은 소셜 미디어 플랫폼에서 여성들을 대상으로 하는 온라인 댓글에 대한 수작업 레이블링 코퍼스를 개발하기 위해.
  • 저자원, 코드 스위칭이 있는 아랍어 방언 환경에서 성차별 탐지에 적합한 다양한 기계 학습 및 딥러닝 모델의 성능 평가를 위해.
  • 특히 성별에 기반한 혐오 발언에 초점을 맞춘 아랍어 혐오 발언 탐지 분야의 향후 연구를 위한 기준을 마련하기 위해.
  • 향후 변환 및 다국어 언어 식별 기술 통합을 통해 탐지 성능 향상을 위해.

제안 방법

  • 여성과 관련된 유튜브 댓글을 자동으로 수집하여 총 5,000개의 초기 댓글을 확보하였다.
  • 세 명의 알제리 다리자어 모국어 사용자가 표준화된 지침을 기반으로 댓글을 혐오 발언 또는 비혐오 발언으로 분류하였다.
  • 모든 분석자가 동일한 판단을 내린 3,798개의 댓글을 바탕으로 균형 잡히지 않은 코퍼스(비혐오 3,006개, 혐오 792개)를 구성하였다.
  • 비교 평가를 위해 동일한 합의 집합에서 무작위로 1,798개의 균형 잡힌 댓글을 추출하였다.
  • 기계 학습 모델(LSVC, GNB, LR, SGD, RF)과 딥러닝 모델(CNN, LSTM, Bi-LSTM)을 코퍼스에 대해 훈련 및 평가하였다.
  • 딥러닝 모델에서 텍스트 시퀀스를 표현하기 위해 Word2Vec과 FastText 임베딩을 사용하였다.

실험 결과

연구 질문

  • RQ1아랍어, 프랑스어, 영어로의 코드 스위칭이 있는 알제리 다리자어에서 다양한 기계 학습 및 딥러닝 모델의 성차별 탐지 성능는 어떠한가?
  • RQ2코퍼스의 선택(균형 잡힌 vs. 균형 잡히지 않은)이 성차별 탐지 성능에 어떤 영향을 미치는가?
  • RQ3CNN, LSTM, Bi-LSTM와 같은 딥러닝 모델이 저자원, 코드 스위칭이 있는 아랍어 방언 코퍼스에서 전통적인 기계 학습 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ4변환 및 언어 식별과 같은 사전 처리 기법을 통해 어떤 성능 향상이 달성될 수 있는가?
  • RQ5수작업 레이블링이 되어 공개 가능한 코퍼스가 향후 아랍어 혐오 발언 탐지 연구에 어떻게 기여할 수 있는가?

주요 결과

  • CNN 모델이 균형 잡히지 않은 코퍼스에서 F1 스코어 86%를 기록하여 LSTM 및 Bi-LSTM 모델보다 뛰어난 성능을 보였다.
  • Bi-LSTM 모델은 균형 잡히지 않은 코퍼스에서 F1 스코어 85%를 기록하여 코드 스위칭 텍스트에서 시퀀스 모델링에 강력한 성능을 보였다.
  • CNN 모델은 균형 잡힌 코퍼스에서 F1 스코어 82%를 기록하여 클래스 불균형에도 불구하고 뛰어난 안정성을 보였다.
  • LSVC 모델은 균형 잡히지 않은 코퍼스에서 F1 스코어 80%를 기록하여 전통적 분류기 중 경쟁적인 성능을 보였다.
  • GNB 및 LR 모델은 각각 F1 스코어 61%와 72%를 기록하여 이 작업에 대해 한계가 있음을 보여주었다.
  • 연구는 향후 정확도 향상을 위해 변환 및 다국어 언어 식별 기술의 통합이 핵심 향상 요소임을 규명하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.