[논문 리뷰] Abusive and Threatening Language Detection in Urdu using Supervised Machine Learning and Feature Combinations
이 논문은 하이브리드 특성 공학과 앙상블 모델링을 사용하여 우르두어 트윗에서 폭력적이고 위협적인 언어를 감지하기 위한 지도 학습 기반 접근법을 제시한다. Task A(폭력적 언어 감지)에서 F1 스코어 0.8318, Task B(위협적 언어 감지)에서 F1 스코어 0.4931를 기록하였으며, SVM과 최적화된 특성 조합(예: 트리그램 n-gram 및 사전 학습된 우르두어 Word2Vec)이 초모수 조정 및 오버샘플링을 통한 데이터 균형 조정 후 최고의 성능을 보였다.
This paper presents the system descriptions submitted at the FIRE Shared Task 2021 on Urdu's Abusive and Threatening Language Detection Task. This challenge aims at automatically identifying abusive and threatening tweets written in Urdu. Our submitted results were selected for the third recognition at the competition. This paper reports a non-exhaustive list of experiments that allowed us to reach the submitted results. Moreover, after the result declaration of the competition, we managed to attain even better results than the submitted results. Our models achieved 0.8318 F1 score on Task A (Abusive Language Detection for Urdu Tweets) and 0.4931 F1 score on Task B (Threatening Language Detection for Urdu Tweets). Results show that Support Vector Machines with stopwords removed, lemmatization applied, and features vector created by the combinations of word n-grams for n=1,2,3 produced the best results for Task A. For Task B, Support Vector Machines with stopwords removed, lemmatization not applied, feature vector created from a pre-trained Urdu Word2Vec (on word unigrams and bigrams), and making the dataset balanced using oversampling technique produced the best results. The code is made available for reproducibility.
연구 동기 및 목표
- 우르두어 소셜미디어 콘텐츠의 폭력적이고 위협적인 언어를 식별하기 위한 견고한 시스템 개발.
- 우르두어의 저자원 NLP 환경에서 다양한 특성 공학 기법의 효과성 평가.
- 데이터 균형 조절 및 언어학적 전처리를 통한 지도 학습을 통한 분류 성능 향상.
- 우르두어 폭력적 언어 감지에 대한 재현 가능하고 오픈소스 솔루션 기여.
- FIRE 2021 공동 과제인 우르두어 폭력적 및 위협적 언어 감지에서 경쟁력 있는 성과 달성.
제안 방법
- 우르두어 텍스트 입력을 정제하기 위해 정지어 제거 및 표제어 추출을 적용.
- Task A에 대해 유니그램, 바이그램, 트리그램(n-gram) 조합을 사용한 특성 벡터를 구성.
- Task B에 대해 유니그램 및 바이그램에 사전 학습된 우르두어 Word2Vec 임베딩을 활용.
- 양쪽 작업 모두 주로 서포트 벡터 머신(SVM)을 분류기로 사용.
- Task B의 불균형 데이터셋을 균형 조절하기 위해 SMOTE 오버샘플링 적용.
- 반복적 실험과 교차 검증을 통한 초모수 최적화.
실험 결과
연구 질문
- RQ1폭력적 언어 감지에서 가장 높은 F1 스코어를 얻기 위해 어떤 언어학적 전처리 및 특성 공학 조합이 가장 효과적인가?
- RQ2저자원 우르두어 NLP 환경에서 데이터 불균형은 위협적 언어 감지 모델의 성능에 어떤 영향을 미치는가?
- RQ3사전 학습된 Word2Vec 임베딩은 우르두어 위협적 언어 감지의 분류 성능 향상에 기여하는가?
- RQ4표제어 추출과 정지어 제거는 우르두어 폭력적 언어 감지에서 모델 일반화에 어떤 영향을 미치는가?
- RQ5다양한 n-gram 조합은 우르두어 트윗에서 폭력적 언어 패턴을 어떻게 비교하여 포착하는가?
주요 결과
- Task A에서 가장 높은 성능을 보인 모델은 SVM에 n-gram 특성(n=1,2,3), 정지어 제거 및 표제어 추출을 적용하여 F1 스코어 0.8318를 달성했다.
- Task B에서는 SVM에 사전 학습된 우르두어 Word2Vec 임베딩을 사용하고, 표제어 추출을 생략하며 SMOTE 기반 오버샘플링을 적용하여 최고의 F1 스코어 0.4931를 기록했다.
- 표제어 추출은 Task A에서 성능 향상을 이끌었지만, Task B에서는 이를 생략하는 것이 약간 유리하여, 작업에 따라 언어학적 전처리가 다를 필요가 있음을 시사한다.
- 트리그램 n-gram을 활용한 특성 공학은 우르두어 트윗에서 폭력적 언어의 감지를 크게 향상시켰다.
- 오버샘플링을 통한 데이터 균형 조절은 매우 불균형한 데이터셋을 가진 Task B에서 F1 스코어 향상에 필수적이었다.
- 최종 모델은 初기 제출 성능을 뛰어넘었으며, 대회 후 초모수 조정 및 실험의 가치를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.