Skip to main content
QUICK REVIEW

[논문 리뷰] Code-mixed Sentiment and Hate-speech Prediction

Anjali Yadav, Tanya Garg|arXiv (Cornell University)|2024. 05. 21.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 영어-힌디어 및 영어-슬로베니아어 혼합 텍스트를 위한 네 가지 새로운 双어 마스크 언어 모델을 소개하며, 특히 비공식적인 소셜 미디어 데이터에 특화된 사전 훈련을 수행한다. 감성 분석 및 혐오 발언 탐지 작업에서 단어별, 양어, 다어, 생성형 모델을 평가한 결과, 미세조정된 양어 모델과 소셜 미디어 전용 다어 모델이 일반 목적 및 대규모 생성형 모델보다 뛰어난 성능을 보였으며, 힌디어에서는 HingRoBERTa가 가장 높은 F1 점수를 기록했고, 슬로베니아어에서는 SlEng-BERT가 높은 성능을 보였다.

ABSTRACT

Code-mixed discourse combines multiple languages in a single text. It is commonly used in informal discourse in countries with several official languages, but also in many other countries in combination with English or neighboring languages. As recently large language models have dominated most natural language processing tasks, we investigated their performance in code-mixed settings for relevant tasks. We first created four new bilingual pre-trained masked language models for English-Hindi and English-Slovene languages, specifically aimed to support informal language. Then we performed an evaluation of monolingual, bilingual, few-lingual, and massively multilingual models on several languages, using two tasks that frequently contain code-mixed text, in particular, sentiment analysis and offensive language detection in social media texts. The results show that the most successful classifiers are fine-tuned bilingual models and multilingual models, specialized for social media texts, followed by non-specialized massively multilingual and monolingual models, while huge generative models are not competitive. For our affective problems, the models mostly perform slightly better on code-mixed data compared to non-code-mixed data.

연구 동기 및 목표

  • 다국어 비공식 환경에서 혼합 언어 감성 및 혐오 발언 분석을 위한 효과적인 대규모 언어 모델의 부족을 해결하기 위해.
  • 영어-힌디어 및 영어-슬로베니아어를 위한 특별히 비공식적인 혼합 언어 코퍼스에 훈련된 새로운 이중 마스크 언어 모델을 개발하기 위해.
  • 단어별, 이중어, 다어, 생성형 모델 등 다양한 LLM 유형이 혼합 언어 정서 컴퓨팅 작업에서 어떻게 성능을 보이는지 평가하기 위해.
  • 혼합 언어 데이터가 감성 및 공격적 언어 탐지에서 비혼합 언어 데이터보다 본질적으로 더 쉽게 분류되는지 조사하기 위해.
  • 기존 언어 탐지 도구가 혼합 언어 텍스트를 식별하는 데 가지는 한계를 평가하기 위해.

제안 방법

  • 혼합 언어 소셜 미디어 코퍼스를 사용하여 영어-힌디어를 위한 RoBERTa-en-hi-codemixed 및 MuRIL-en-hi-codemixed, 영어-슬로베니아어를 위한 SlEng-BERT 및 SloBERTa-SlEng을 포함한 네 가지 새로운 마스크 언어 모델을 사전 훈련하였다.
  • 다섯 개 언어(프랑스어, 힌두어, 러시아어, 슬로베니아어, 타밀어)에서 감성 분석 및 공격적 언어 탐지라는 두 가지 정서 컴퓨팅 작업에 대해 이 모델들을 미세조정하였다.
  • mBERT, XLM-R, TwHIN-BERT, GPT-3, Llama2-7B 등 다양한 LLM을 혼합 언어 및 비혼합 언어 데이터 하위집합에서 평가하였다.
  • 모델 성능을 비교하기 위해 F1 점수와 같은 표준 지표를 사용하였다.
  • 모델의 행동과 언어 탐지 약점 평가를 위해 수동 점검 및 대조 세트 분석을 수행하였다.
  • 저자원 및 혼합 언어 환경에 적합하도록 사전 훈련된 모델을 적응시키기 위해 전이 학습 기법을 적용하였다.

실험 결과

연구 질문

  • RQ1이중어 및 다어 언어 모델은 단어별 및 대규모 다어 모델 대비 혼합 언어 감성 및 혐오 발언 탐지에서 어떻게 성능을 보이는가?
  • RQ2비공식적 혼합 언어 소셜 미디어 데이터에 기반한 훈련이 정서 컴퓨팅 작업 성능에 향상 효과를 미치는가?
  • RQ3감성 및 공격적 언어 탐지에서 혼합 언어 데이터가 비혼합 언어 데이터보다 본질적으로 더 쉽게 분류되는가?
  • RQ4GPT-3 및 Llama2-7B와 같은 대규모 생성형 모델은 전문 모델 대비 혼합 언어 정서 작업에서 어떻게 성능을 보이는가?
  • RQ5기존 언어 탐지 도구가 혼합 언어 텍스트를 식별하는 데 가지는 한계는 무엇인가?

주요 결과

  • 이중어 HingRoBERTa 모델은 영어-힌디어 혼합 언어 데이터에서 감성 분석 작업에서 F1 점수 0.876을 기록하여 모든 다른 모델보다 뛰어난 성능을 보였다.
  • 최근 도입된 RoBERTa-en-hi-codemixed 및 MuRIL-en-hi-codemixed 모델은 힌두어에서 혼합 언어 데이터에 대해 비혼합 언어 데이터보다 더 높은 성능을 보였다.
  • 슬로베니아어-영어 혼합 언어에서 SlEng-BERT는 감성 분석에서 F1 점수 0.874, 공격적 언어 탐지에서 0.865를 기록하여 다른 모델보다 뛰어난 성능을 보였다.
  • 소셜 미디어 전용 혼합 언어 코퍼스에 기반한 모델, 예를 들어 HingRoBERTa 및 SlEng-BERT는 일반 목적의 다어 및 단어별 모델보다 일관되게 뛰어난 성능을 보였다.
  • GPT-3 및 Llama2-7B는 성능이 열악했으며, GPT-3는 힌두어 감성 분석에서 F1 점수 0.466에 머물러 있어 혼합 언어 텍스트에 대한 적응 능력이 제한됨을 시사했다.
  • 놀랍게도 대부분의 모델이 비혼합 언어 데이터보다 혼합 언어 데이터에서 略로 높은 성능을 보였으며, 이는 혼합 언어 논의에서 언어 간 공통된 정서 패턴이 존재할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.