[논문 리뷰] CUSATNLP@HASOC-Dravidian-CodeMix-FIRE2020:Identifying Offensive Language from ManglishTweets
이 논문은 코드 믹스된 말레이루아-영어 텍스트(로마자 스크립트로 작성된 망글리시)에서 폭력적 언어를 식별하기 위한 신경망 기반 접근법을 제시한다. 이는 두 가지 임베딩 방법(Keras 임베딩 및 Doc2Vec)과 세 가지 분류기 시스템을 사용한다. 최고 성능을 보인 모델은 두 분류기의 가중치 조합으로 구성된 앙상블로, 가중치 F1 스코어 0.54를 기록하여 불균형하고 자원이 적은 코드 믹스된 폭력적 언어 탐지 작업에서 중간 정도의 효과성을 보였다.
With the popularity of social media, communications through blogs, Facebook, Twitter, and other plat-forms have increased. Initially, English was the only medium of communication. Fortunately, now we can communicate in any language. It has led to people using English and their own native or mother tongue language in a mixed form. Sometimes, comments in other languages have English transliterated format or other cases; people use the intended language scripts. Identifying sentiments and offensive content from such code mixed tweets is a necessary task in these times. We present a working model submitted for Task2 of the sub-track HASOC Offensive Language Identification- DravidianCodeMix in Forum for Information Retrieval Evaluation, 2020. It is a message level classification task. An embedding model-based classifier identifies offensive and not offensive comments in our approach. We applied this method in the Manglish dataset provided along with the sub-track.
연구 동기 및 목표
- 코드 믹스된 소셜 미디어 텍스트, 특히 망글리시(로마자 스크립트로 쓴 말레이루아어)에서 폭력적 콘텐츠를 탐지하는 과제를 해결하기 위해.
- 기존 모델이 성능을 저하시킬 수 있는 저자원, 多언어 환경에서 폭력적 언어를 분류하기 위한 강력한 시스템을 개발하기 위해.
- 코드 믹스 텍스트에서 폭력적 언어 탐지에 대해 Keras 임베딩과 Doc2Vec라는 서로 다른 임베딩 기법의 효과를 평가하기 위해.
- 불균형 데이터셋에서 성능을 향상시키기 위해 다수의 분류기 예측을 조합하는 앙상블 방법의 효과를 탐색하기 위해.
- 드라비디아어 코드 믹스 소셜 미디어 콘텐츠에 대해 재현 가능한 폭력적 언어 탐지 시스템을 기여하기 위해. FIRE 2020 HASOC 서브트랙을 대상으로 한다.
제안 방법
- 텍스트 전처리는 tweet-preprocessor 라이브러리를 사용하여 URL, 사용자명, 해시태그, 반복 문자, 숫자를 제거하고, 모든 텍스트를 소문자로 변환하는 방식으로 수행되었다.
- 문장 표현은 두 가지 방법으로 생성되었다: (1) 원-핫 인코딩 및 패딩된 시퀀스를 사용한 Keras 임베딩 레이어로 50차원 벡터를 생성하고, (2) 가변 길이 텍스트에서 분산 문장 표현을 학습하기 위한 Doc2Vec.
- 세 가지 다른 분류 시스템을 구현하였다: 시스템 A는 0.2의 순환 드롭아웃을 가진 단방향 LSTM과 시그모이드 출력 레이어를 사용하였고, 시스템 B는 ReLU 활성화 함수를 사용한 3층 밀집 네트워크와 시그모이드 출력 레이어를 사용하였다.
- 시스템 C는 시스템 A와 B의 예측을 조합하여 결정 함수를 적용하였다: 두 모델이 동일한 클래스를 예측할 경우 결과는 그 클래스로 취하고, 그렇지 않으면 예측 확률의 합이 1을 초과하는 경우에 따라 클래스를 결정하였다.
- 모든 모델는 이진 교차 엔트로피 손실을 사용하여 훈련되었고, 정밀도, 재현도, F1 스코어를 평가 지표로 사용하였으며, 클래스 불균형을 처리하기 위해 가중 평균 F1 스코어를 사용하였다.
- 평가 작업은 1,000개의 망글리시 트윗으로 구성된 테스트 세트에서 수행되었고, scikit-learn의 classification_report 함수를 사용하여 지표를 계산하였다.
실험 결과
연구 질문
- RQ1LSTM과 밀집 네트워크와 같은 전통적인 신경망 아키텍처는 코드 믹스된 망글리시 트윗에서 폭력적 콘텐츠 탐지에 얼마나 효과적인가?
- RQ2Keras 임베딩과 Doc2Vec라는 서로 다른 임베딩 기법은 저자원, 코드 믹스 텍스트에서 폭력적 언어 탐지 성능에 얼마나 큰 영향을 미치는가?
- RQ3다수의 분류기 예측을 조합하는 앙상블 방법은 개별 모델보다 불균형한 코드 믹스 데이터셋에서 탐지 성능을 향상시킬 수 있는가?
- RQ4FIRE 2020 HASOC 드라비디아어 코드 믹스 폭력적 언어 탐지 과제에서 단순한 트랜스포머 기반 모델이 아닌 모델의 성능은 어떠한가?
- RQ5저자원, 다국어 환경에서 폭력적 및 비폭력적 클래스 간 정밀도, 재현도, F1 스코어는 어떻게 변화하는가?
주요 결과
- Keras 임베딩과 LSTM을 기반으로 한 시스템 A는 가중치 F1 스코어 0.53을 기록하였으며, 평균적으로 정밀도와 재현도가 각각 0.54였다.
- Doc2Vec와 깊은 밀집 네트워크를 사용한 시스템 B는 더 낮은 가중치 F1 스코어 0.48을 기록하였으며, 소수의 폭력적 클래스에서 성능이 떨어졌고(F1=0.40), 이는 성능 저하를 의미한다.
- 시스템 A와 B의 예측을 조합한 앙상블 모델인 시스템 C는 가장 높은 가중치 F1 스코어 0.54를 기록하였으며, 이는 앙상블 방법이 개별 모델의 약점을 보완할 수 있음을 보여준다.
- 모든 시스템에서 마이크로 및 매크로 F1 스코어는 약 0.54로 일관되게 유지되었으며, 이는 일관된 중간 정도의 전반적 성능를 의미한다.
- 모델는 '폭력적이지 않음' 클래스에 대해 더 높은 재현도(시스템 A에서 0.60)를 보였지만, 특히 시스템 B에서는 '폭력적' 클래스에서 재현도가 0.32로 떨어져 어려움을 겪었다.
- 고급 임베딩 기법을 사용했음에도 불구하고 모델의 성능은 중간 수준에 머물렀으며, 이는 코드 믹스된 드라비디아어 언어의 표현 학습 분야에서 향상 여지가 여전히 크다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.