Skip to main content
QUICK REVIEW

[논문 리뷰] Mono vs Multilingual BERT for Hate Speech Detection and Text Classification: A Case Study in Marathi

Abhishek Velankar, Hrushikesh Patil|arXiv (Cornell University)|2022. 04. 19.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 연구는 마라티어 텍스트 분류를 위한 단어별 및 다국어 BERT 모델을 비교하며, MahaBERT, MahaALBERT, MahaRoBERTa를 mBERT, indicBERT, xlm-RoBERTa와 비교하여 혐오 발언 탐지 및 감성 분석을 평가한다. 단어별 모델이 다국어 모델보다 일관되게 뛰어난 성능을 보이며, MahaRoBERTa가 HASOC-2021에서 89.0%의 정확도를 기록하고 MahaAlBERT가 기사 데이터셋에서 94.5%의 정확도를 달성하여 마라티어 NLP 작업에서 뛰어난 성능과 더 풍부한 문장 임베딩을 제공함을 보여준다.

ABSTRACT

Transformers are the most eminent architectures used for a vast range of Natural Language Processing tasks. These models are pre-trained over a large text corpus and are meant to serve state-of-the-art results over tasks like text classification. In this work, we conduct a comparative study between monolingual and multilingual BERT models. We focus on the Marathi language and evaluate the models on the datasets for hate speech detection, sentiment analysis and simple text classification in Marathi. We use standard multilingual models such as mBERT, indicBERT and xlm-RoBERTa and compare with MahaBERT, MahaALBERT and MahaRoBERTa, the monolingual models for Marathi. We further show that Marathi monolingual models outperform the multilingual BERT variants on five different downstream fine-tuning experiments. We also evaluate sentence embeddings from these models by freezing the BERT encoder layers. We show that monolingual MahaBERT based models provide rich representations as compared to sentence embeddings from multi-lingual counterparts. However, we observe that these embeddings are not generic enough and do not work well on out of domain social media datasets. We consider two Marathi hate speech datasets L3Cube-MahaHate, HASOC-2021, a Marathi sentiment classification dataset L3Cube-MahaSent, and Marathi Headline, Articles classification datasets.

연구 동기 및 목표

  • 마라티어 특화 NLP 작업, 예를 들어 혐오 발언 탐지 및 감성 분석에서 단어별 및 다국어 BERT 모델의 성능을 평가하는 것.
  • 큰 마라티어 코퍼스에서의 단어별 미사전학습이 저자원 인도어 언어에 대해 다국어 미사전학습보다 더 나은 표현을 제공하는지 평가하는 것.
  • 모델 간 고정된 BERT 인코더에서 유도된 문장 임베딩을 비교하여 그 일반화 능력이 다양한 도메인에 어떻게 작용하는지 평가하는 것.
  • 특히 마라티어와 같이 자원이 부족한 언어에 대해 단어별 모델이 단일 언어 후행 작업에서 뛰어나다는 경험적 증거를 제공하는 것.
  • 표준화된 데이터셋에서 최신 모델을 벤치마킹하여 마라티어 NLP를 위한 모델 선택 가이드라인을 NLP 커뮤니티에 제공하는 것.

제안 방법

  • L3Cube-MahaHate, HASOC-2021, L3Cube-MahaSent, Marathi Headlines/Articles 등의 마라티어 데이터셋에 대해 MahaBERT, MahaALBERT, MahaRoBERTa와 같은 마라티어 단어별 BERT 변종을 미세조정한다.
  • 동일한 마라티어 데이터셋에 대해 미세조정된 표준 다국어 모델인 mBERT, indicBERT, xlm-RoBERTa와 비교한다.
  • 두 가지 학습 전략을 시행: BERT 인코더 레이어를 고정하지 않고 전체 미세조정하는 것과 BERT 인코더 레이어를 고정하고 분류기 헤드만 학습하는 것.
  • BERT 인코더를 고정하고 [CLS] 토큰 표현을 사용하여 후행 분류 작업을 위한 문장 임베딩을 평가한다.
  • L3Cube-MahaCorpus(752M 토큰)를 포함한 대규모 단어별 코퍼스를 사용하여 단어별 모델을 미사전학습한다.
  • 혐오 발언 탐지, 감성 분석, 텍스트 분류 작업을 포함한 다섯 가지 별도의 후행 분류 실험을 수행한다.

실험 결과

연구 질문

  • RQ1큰 마라티어 코퍼스에서 미사전학습된 단어별 BERT 모델이 마라티어 텍스트 분류 작업에서 다국어 BERT 모델보다 뛰어나게 성능을 발휘하는가?
  • RQ2단어별 및 다국어 BERT 모델의 문장 임베딩은 마라티어 NLP 작업에서 분류 능력 측면에서 어떻게 비교되는가?
  • RQ3고정된 BERT 인코더 레이어가 다양한 마라티어 텍스트 분류 데이터셋 간에 일반화 가능한 문장 표현을 얼마나 잘 생성하는가?
  • RQ4MahaBERT, MahaALBERT, MahaRoBERTa 중 어느 모델 아키텍처가 마라티어 혐오 발언 탐지 및 감성 분류에서 가장 높은 성능을 내는가?
  • RQ5다국어 모델이 다국어 간 전이를 위해 설계되었음에도 불구하고, 왜 단어별 모델이 더 뛰어난 성능을 보이는가?

주요 결과

  • MahaRoBERTa가 HASOC-2021 혐오 발언 탐지 데이터셋에서 89.0%의 정확도를 기록하며 모든 다국어 모델을 능가했다.
  • MahaAlBERT가 마라티어 기사 분류 데이터셋에서 94.5%의 정확도를 기록하여 테스트된 모든 모델 중 최고 성능을 기록했다.
  • 모든 다섯 가지 후행 작업에서 단어별 모델이 다국어 모델을 일관되게 능가했으며, MahaBERT는 혐오 발언 탐지에서 비고정 설정에서 88.3%의 정확도를 기록했다.
  • BERT 인코더 레이어를 고정한 결과 성능이 크게 떨어졌으며, 예를 들어 MahaBERT는 L3Cube-MahaHate에서 82.4%의 정확도를 기록하여 비고정 설정보다 열등한 성능을 보였다. 이는 고정된 모델에서 일반화 능력이 떨어지는 문장 임베딩을 유도함을 시사한다.
  • MahaBERT 및 MahaAlBERT와 같은 단어별 모델의 문장 임베딩은 다국어 모델 대비 더 풍부한 표현을 제공했으며, 특히 미세조정된 경우 두드러졌다.
  • 더 나은 문장 표현을 제공함에도 불구하고, 단어별 임베딩은 도메인 외부의 소셜 미디어 데이터셋에 대해 일반화 능력이 떨어졌으며, 이는 도메인 적응형 문장 임베딩 모델의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.