Skip to main content
QUICK REVIEW

[논문 리뷰] IIITG-ADBU@HASOC-Dravidian-CodeMix-FIRE2020: Offensive Content Detection in Code-Mixed Dravidian Text

Arup Baruah, Kaushik Amar Das|arXiv (Cornell University)|2021. 07. 29.
Hate Speech and Cyberbullying Detection인용 수 6
한 줄 요약

이 논문은 복합 언어로 된 드라비디아어 언어—마라티어-영어 및 타밀-영어—에서의 공격적 언어 탐지에 대해 SVM 및 XLM-RoBERTa 모델의 비교 연구를 제시한다. TF-IDF 특징을 사용한 SVM 분류기는 복합 문자 및 단어 n-gram을 조합한 특징을 사용하여 유튜브 마라티어 데이터에서 F1 스코어 0.95(1위)를 기록했고, 트위터 마라티어 데이터에서는 F1 스코어 0.76(3위)를 기록했다. 반면 XLM-RoBERTa는 타밀-영어 트위터 데이터에서 F1 스코어 0.87(3위)를 기록했다.

ABSTRACT

This paper presents the results obtained by our SVM and XLM-RoBERTa based classifiers in the shared task Dravidian-CodeMix-HASOC 2020. The SVM classifier trained using TF-IDF features of character and word n-grams performed the best on the code-mixed Malayalam text. It obtained a weighted F1 score of 0.95 (1st Rank) and 0.76 (3rd Rank) on the YouTube and Twitter dataset respectively. The XLM-RoBERTa based classifier performed the best on the code-mixed Tamil text. It obtained a weighted F1 score of 0.87 (3rd Rank) on the code-mixed Tamil Twitter dataset.

연구 동기 및 목표

  • 코드 믹스 드라비디아어 언어, 특히 마라티어-영어 및 타밀-영어에서 공격적 콘텐츠를 탐지하는 데 도전하는 것.
  • 저자원, 코드 믹스 소셜 미디어 텍스트에서 전통적인 기계 학습(SVM)과 사전 훈련된 다국어 트랜스포머 모델(XLM-RoBERTa)을 평가하는 것.
  • 다양한 데이터 소스(유튜브 대 트위터)와 언어 조합(마라티어-영어, 타밀-영어) 간의 모델 성능을 비교하는 것.
  • 저자원, 코드 믹스 환경에서 공격적 언어 탐지에 가장 효과적인 특징 공학 및 모델 아키텍처를 규명하는 것.

제안 방법

  • 문자 n-gram(1–6)과 단어 n-gram(1–3)의 조합에서 유도된 TF-IDF 특징을 사용해 SVM 분류기를 훈련시켰다.
  • Hugging Face Transformers 라이브러리를 사용하여 Adam 옵timizer와 가중치 감소를 적용해 XLM-RoBERTa base 모델을 이진 분류 작업에 맞추기 위해 미세조정했다.
  • Task 2의 개발 세트를 훈련 데이터에서 계층적 샘플링을 통해 생성하여 클래스 균형을 유지했다.
  • XLM-RoBERTa 훈련 중에는 조기 정지와 학습률 스케줄링(2e-5)을 적용했으며, epsilon=1e-8로 설정했다.
  • 해석 가능성 향상을 위해 개발 및 테스트 세트에서 가중 F1, 정밀도, 재현율을 평가하고, 혼동 행렬을 활용했다.
  • 최종 모델은 개발 세트 성능에 기반해 선택되었으며, 공유 작업에 제출된 것은 유일하게 최고 성능을 낸 구성만 제출되었다.

실험 결과

연구 질문

  • RQ1코드 믹스 드라비디아어 텍스트에서 공격적 언어 탐지에 대해 SVM과 XLM-RoBERTa 모델의 성능을 비교하면 어떻게 되는가?
  • RQ2SVM에 대해 마라티어-영어 코드 믹스 텍스트에서 어떤 특징 표현 방식(문자 n-gram, 단어 n-gram, 또는 그 조합)이 가장 우수한 결과를 낼 수 있는가?
  • RQ3데이터 소스(유튜브 대 트위터)의 선택이 마라티어-영어 공격적 언어 탐지 성능에 유의미한 영향을 미치는가?
  • RQ4전통적인 SVM과 TF-IDF를 사용한 것에 비해, XLM-RoBERTa가 저자원, 코드 믹스 타밀-영어 및 마라티어-영어 텍스트 처리에 얼마나 효과적인가?
  • RQ5XLM-RoBERTa가 마라티어-영어 트위터 데이터에서 SVM에 비해 성능이 떨어지는 이유는 무엇이며, 이러한 성능 저하에 기여할 수 있는 요인들은 무엇인가?

주요 결과

  • 문자 및 단어 n-gram의 조합 TF-IDF 특징을 사용한 SVM 분류기는 유튜브 마라티어 데이터셋에서 F1 스코어 0.95(1위)를 기록했다.
  • 트위터 마라티어 데이터셋에서는 동일한 SVM 모델이 가중 F1 스코어 0.7623을 기록하여 모든 제출물 중 3위를 차지했다.
  • 타밀-영어 트위터 데이터셋에서는 XLM-RoBERTa 모델이 가중 F1 스코어 0.8669를 기록해 전체 3위를 차지했으며, 이 작업에서 모든 SVM 변종보다 뛰어난 성능을 보였다.
  • 단어 n-gram만을 사용해 훈련한 SVM 모델은 타밀-영어 데이터에 대해 개발 세트 F1 스코어 0.8714를 기록해 이 언어 조합에서 뛰어난 성능을 보였다.
  • XLM-RoBERTa 모델은 마라티어-영어 트위터 데이터에서 F1 스코어 0.5171에 그치며, 이는 저자원 코드 믹스 드라비디아어 텍스트를 처리하는 데 이 아키텍처의 한계를 보여준다.
  • 혼동 행렬 분석 결과, 마라티어-영어 유튜브 데이터에 대한 SVM 모델은 공격적 인스턴스 중 단 2개만 비공격으로 잘못 분류했으며, 이는 이 테스트 세트에서 높은 정밀도와 재현율을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.