Skip to main content
QUICK REVIEW

[논문 리뷰] WLV-RIT at HASOC-Dravidian-CodeMix-FIRE2020: Offensive Language Identification in Code-switched YouTube Comments

Tharindu Ranasinghe, Sarthak Gupte|arXiv (Cornell University)|2020. 11. 01.
Hate Speech and Cyberbullying Detection참고 문헌 33인용 수 7
한 줄 요약

이 논문은 XLM-RoBERTa와 전이 학습 전략을 활용하여 코드 믹스드 말라요람-영어 유튜브 댓글에서 공격적 언어 식별을 위한 WLV-RIT 시스템을 제시한다. HASOC-2020 공동 과제에서 0.89의 가중 F1 스코어를 기록하여 참가자 12명 중 5위를 차지하였으며, 저자원 코드 믹스드 드라비디언 텍스트에서 다국어 전이 학습의 효과성을 입증한다.

ABSTRACT

This paper describes the WLV-RIT entry to the Hate Speech and Offensive Content Identification in Indo-European Languages (HASOC) shared task 2020. The HASOC 2020 organizers provided participants with annotated datasets containing social media posts of code-mixed in Dravidian languages (Malayalam-English and Tamil-English). We participated in task 1: Offensive comment identification in Code-mixed Malayalam Youtube comments. In our methodology, we take advantage of available English data by applying cross-lingual contextual word embeddings and transfer learning to make predictions to Malayalam data. We further improve the results using various fine tuning strategies. Our system achieved 0.89 weighted average F1 score for the test set and it ranked 5th place out of 12 participants.

연구 동기 및 목표

  • 코드 믹스드 드라비디언 언어 텍스트, 특히 말라요람-영어 댓글을 대상으로 견고한 공격적 언어 식별 시스템을 개발하기 위해.
  • 말라요람과 같은 저자원 언어에 대해 애초에 부족한 애너테이션 데이터 문제를 해결하기 위해 고자원 영어 데이터셋에서의 전이 학습을 활용하기 위해.
  • 다국어 및 코드 믹스드 소셜 미디어 텍스트에서 공격적 콘텐츠를 탐지하기 위해 다양한 피닝튜닝 전략과 트랜스포머 아키텍처의 효과를 평가하기 위해.
  • 특히 비공격적 콘텐츠가 잘못 분류되어 공격적이라고 판단되는 데이터셋 편향이 모델 성능에 미치는 영향을 조사하기 위해.

제안 방법

  • 영어 공격적 언어 식별에서의 지식을 말라요람-영어 코드 믹스드 텍스트로 전이하기 위해 XLM-RoBERTa와 BERT-multilingual 모델을 활용한 다국어 맥락적 단어 임베딩을 사용하였다.
  • HASOC-2020 말라요람-영어 코드 믹스드 데이터셋에 대해 사전 학습된 다국어 트랜스포머를 피팅하여 전이 학습을 적용하였으며, 보조 학습 데이터로 OLID 영어 공격적 언어 데이터셋을 활용하였다.
  • 표준 피팅, 적대적 훈련(Adversarial Training, AT), 및 마스킹 언어 모델링(Masked Language Modeling, MLM)을 포함한 여러 피팅 전략을 구현하여 모델의 강건성과 성능을 향상시켰다.
  • 기본 모델 비교 및 아블레이션 연구를 위해 전통적인 기계 학습 모델(Naive Bayes, SVM, Random Forest)과 bag-of-words 특징을 조합하였다.
  • 구두점 제거, 이모지 제거, NLTK를 활용한 영어 단어 어간 추출을 포함한 데이터 전처리를 수행하였다.
  • SVM 및 Random Forest의 초모델을 그리드 서치를 통해 최적화하였으며, 최적의 값은 alpha=0.001, random state=5, max iteration=15, n_estimators=500로 설정되었다.

실험 결과

연구 질문

  • RQ1고자원 영어 공격적 언어 데이터셋에서의 전이 학습이 저자원 코드 믹스드 드라비디언 언어 텍스트에서의 공격적 언어 식별 성능을 향상시킬 수 있는가?
  • RQ2다양한 피팅 전략(예: 적대적 훈련, 마스킹 언어 모델링)이 코드 믹스드 말라요람-영어 댓글에서의 모델 성능에 어떤 영향을 미치는가?
  • RQ3데이터셋의 불균형과 비공격적 콘텐츠가 잘못 분류되어 공격적이라고 판단되는 현상이 모델 일반화 능력과 F1 스코어에 얼마나 큰 영향을 미치는가?
  • RQ4이러한 저자원, 코드 믹스드 환경에서 전통적인 기계 학습 모델은 트랜스포머 기반 모델보다 어떻게 비교되는가?

주요 결과

  • 전이 학습과 적대적 훈련을 적용한 XLM-RoBERTa 모델(XLM-R (TL) + ASE)이 테스트 세트에서 가장 높은 가중 F1 스코어 0.89를 기록하였으며, 참가자 12명 중 5위를 차지하였다.
  • 최고의 성능을 보인 모델인 XLM-R (TL)에 ASE + 언어 모델링을 적용한 모델은 가중 F1 스코어 0.93을 기록하였으며, 공격적 클래스에 대해 정밀도 97%, 재현율 95%를 기록하였다.
  • 트랜스포머의 높은 성능에도 불구하고, 전통적인 Random Forest 모델이 대부분의 트랜스포머 기반 모델을 앞서 0.87의 가중 F1 스코어를 기록하였으며, 이는 저자원 드라비디언 언어에 대한 다국어 모델 표현의 잠재적 한계를 시사한다.
  • 데이터셋은 심각한 클래스 불균형을 보였으며, 학습 예제 3,200개 중 공격적 예제는 567개 뿐이었고, 약 20~25%의 '공격적' 레이블이 정성적 분석에서 비공격적이라고 판단되었다. 이는 애너테이션 노이즈가 존재할 가능성을 시사한다.
  • OLID 데이터셋에서의 전이 학습이 성능 향상에 크게 기여하였으며, 특히 소수의 공격적 클래스에 대해 재현율과 F1 스코어가 향상됨으로써 모든 모델에서 확인되었다.
  • 적대적 훈련과 언어 모델링 피팅 전략은 항상 모델의 강건성과 일반화 능력을 향상시켰으며, 특히 공격적 클래스에서 가장 뛰어난 성능을 보인 XLM-R 기반 모델에서 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.