Skip to main content
QUICK REVIEW

[논문 리뷰] Overview of Abusive and Threatening Language Detection in Urdu at FIRE 2021

Maaz Amjad, Alisa Zhila|arXiv (Cornell University)|2022. 07. 14.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 우르두어에서 폭력적이고 위협적인 언어 탐지에 대한 공동 과제를 제시하며, 수동으로 주석 처리된 두 개의 데이터셋을 소개한다. 폭력적 언어 탐지에 대해 2,400개의 훈련 및 1,100개의 테스트 트윗을, 위협적 언어 탐지에 대해 6,000개의 훈련 및 3,950개의 테스트 트윗을 포함한다. 최고의 성능을 보인 시스템은 다국어 BERT(m-BERT) 모델을 사용하여 폭력적 언어 탐지 과제에서 F1 스코어 0.880, 위협적 언어 탐지 과제에서 F1 스코어 0.545를 기록했으며, 이는 저자원 우르두어 NLP 과제에 대해 트랜스포머 기반 모델의 효과성을 보여준다.

ABSTRACT

With the growth of social media platform influence, the effect of their misuse becomes more and more impactful. The importance of automatic detection of threatening and abusive language can not be overestimated. However, most of the existing studies and state-of-the-art methods focus on English as the target language, with limited work on low- and medium-resource languages. In this paper, we present two shared tasks of abusive and threatening language detection for the Urdu language which has more than 170 million speakers worldwide. Both are posed as binary classification tasks where participating systems are required to classify tweets in Urdu into two classes, namely: (i) Abusive and Non-Abusive for the first task, and (ii) Threatening and Non-Threatening for the second. We present two manually annotated datasets containing tweets labelled as (i) Abusive and Non-Abusive, and (ii) Threatening and Non-Threatening. The abusive dataset contains 2400 annotated tweets in the train part and 1100 annotated tweets in the test part. The threatening dataset contains 6000 annotated tweets in the train part and 3950 annotated tweets in the test part. We also provide logistic regression and BERT-based baseline classifiers for both tasks. In this shared task, 21 teams from six countries registered for participation (India, Pakistan, China, Malaysia, United Arab Emirates, and Taiwan), 10 teams submitted their runs for Subtask A, which is Abusive Language Detection and 9 teams submitted their runs for Subtask B, which is Threatening Language detection, and seven teams submitted their technical reports. The best performing system achieved an F1-score value of 0.880 for Subtask A and 0.545 for Subtask B. For both subtasks, m-Bert based transformer model showed the best performance.

연구 동기 및 목표

  • 저자원 언어, 특히 1억 7천만 명 이상의 사용자를 보유한 우르두어에서 폭력적이고 위협적인 언어 탐지에 대한 연구 부족을 해결하기 위해.
  • FIRE 2021 및 ODS SoC 2021 프레임워크 내에서 공동 과제를 조직하여 우르두어를 위한 강력한 NLP 시스템 개발을 촉진하기 위해.
  • 미래 연구를 지원하기 위해 공개 가능한 고품질의 수동 주석 처리된 우르두어 폭력적 및 위협적 언어 데이터셋을 제공하기 위해.
  • 기존 기계 학습 기반 방법에서 최신 트랜스포머 모델에 이르기까지 다양한 NLP 접근 방식이 우르두어 텍스트 분류 과제에서 어떻게 작용하는지 평가하기 위해.
  • 온라인 안전과 관련된 우르두어 특화 NLP 과제를 해결하기 위해 6개국의 21개 팀이 참여하는 국제 협력을 촉진하기 위해.

제안 방법

  • 이중 이진 분류 공동 과제를 실시함: 하위 과제 A는 폭력적 대비 비폭력적 언어, 하위 과제 B는 위협적 대비 비위협적 콘텐츠를 다룸.
  • 데이터셋은 트위터 데이터를 기반으로 구성되었으며, 주석 처리는 트위터의 공식 폭력적 및 위협적 행동 정의에 따라 수행됨.
  • 참가자들에게는 정답 레이블이 포함된 훈련 세트와 평가를 위한 숨겨진 레이블이 포함된 테스트 세트가 제공됨.
  • 기준 모델은 로지스틱 회귀와 다국어 BERT(m-BERT)를 사용하여 구현되었으며, 비교를 위해 XLM-RoBERTa도 추가 기준 모델로 제공됨.
  • 평가에는 F1 스코어와 ROC-AUC 지표를 사용하였으며, 결과는 주로 비공개 테스트 세트에서의 F1 스코어 기준으로 순위 매겨짐.
  • 공식 순위에서 제외된 늦은 제출은 정답 공개 이후 잠재적 데이터 泄露를 방지하기 위해 평가의 공정성을 확보하기 위해 제외됨.

실험 결과

연구 질문

  • RQ1m-BERT 및 XLM-RoBERTa와 같은 다국어 트랜스포머 모델이 저자원 우르두어 텍스트에서 폭력적이고 위협적인 언어를 탐지하는 데 얼마나 효과적인가?
  • RQ2기존 기계 학습 기반 방법과 딥 러닝 기반 방법 간에 우르두어 폭력적 및 위협적 언어 탐지에서 성능 격차는 어느 정도인가?
  • RQ3특징 공학 및 사전 학습된 임베딩이 종단 간 컨텍스트 모델링에 비해 분류 성능 향상에 얼마나 기여하는가?
  • RQ4특히 코드 혼합 또는 비공식적인 맥락에서, 다양한 언어적 및 스타일적 패턴에 따라 시스템의 성능은 어떻게 변하는가?
  • RQ5기존 데이터셋은 실제 폭력적 콘텐츠 탐지에서 일반화 및 강건성 지원에 있어 어떤 과제와 한계를 지니는가?

주요 결과

  • 하위 과제 A(폭력적 언어 탐지)에서 우승한 시스템은 m-BERT 모델을 사용하여 F1 스코어 0.880을 기록했으며, 기존 기계 학습 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 하위 과제 B(위협적 언어 탐지)에서는 공식 결과로 F1 스코어 0.545를 기록한 m-BERT 모델이 가장 높은 성능을 보였으며, 이는 위협 탐지가 폭력적 언어 탐지보다 더 어려운 과제임을 시사한다.
  • 공식 대회 종료 후 제출된 팀 SSNCSE_NLP의 늦은 제출 결과는 하위 과제 B에서 F1 스코어 0.805를 기록해, 공식 경기 후 잠재적 데이터 泄露가 있었을 가능성을 시사한다.
  • m-BERT 모델은 두 과제에서 일관되게 다른 접근 방식보다 뛰어난 성능을 보였으며, 우르두어 NLP 과제에 대해 강력한 전이 가능성과 강건성을 보여주었다.
  • SVM, 로지스틱 회귀, 랜덤 포레스트와 같은 기존 모델들은 두 과제에서 F1 스코어가 0.60 이하로 제한적인 성능을 보였으며, 이는 문맥 기반 표현의 필요성을 시사한다.
  • 공개된 주석 처리된 데이터셋(훈련 및 테스트 분할 포함)은 향후 연구와 재현 가능성을 가능하게 하며, 더 큰 규모의 데이터와 모델 파인튜닝을 통해 성능 향상의 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.