QUICK REVIEW
[논문 리뷰] SJ_AJ@DravidianLangTech-EACL2021: Task-Adaptive Pre-Training of Multilingual BERT models for Offensive Language Identification
Sai Muralidhar Jayanthi, Akshat Gupta|arXiv (Cornell University)|2021. 02. 01.
Hate Speech and Cyberbullying Detection참고 문헌 20인용 수 21
한 줄 요약
이 논문은 코드 믹스드 드라비디안 언어(카나다어, 타밀어, 말라요람어)에서의 공격적 언어 식별을 위해 임베딩된 언어 모델(mBERT)과 XLM-RoBERTa 모델의 앙상블을 제안한다. 다국어 BERT에서 마스킹된 언어 모델링을 활용해 태스크 적응형 미세조정을 수행한 결과, EACL 2021 공동 과제에서 카나다어 1위, 말라요람어 2위, 타밀어 3위의 최상위 성능을 기록하였다.
ABSTRACT
In this paper we present our submission for the EACL 2021-Shared Task on Offensive Language Identification in Dravidian languages. Our final system is an ensemble of mBERT and XLM-RoBERTa models which leverage task-adaptive pre-training of multilingual BERT models with a masked language modeling objective. Our system was ranked 1st for Kannada, 2nd for Malayalam and 3rd for Tamil.
연구 동기 및 목표
- 코드 믹스드 드라비디안 언어에 대해 강건한 공격적 언어 식별 시스템을 개발하는 것. 이는 자연어 처리 분야에서 다루지 않은 언어이다.
- 저자원, 코드 믹스드 소셜 미디어 텍스트에 대해 다국어 BERT 모델에 마스킹된 언어 모델링을 활용한 태스크 적응형 미세조정의 효과성을 조사하는 것.
- 모델 앙상블 및 표현 융합 기법을 활용해 불균형적이고 다국어인 데이터셋에서의 성능을 향상시키는 것.
- 입력 형식(현지 문자 vs. 로마자 표기)이 모델 일반화 및 내구성에 미치는 영향을 평가하는 것.
제안 방법
- 각 드라비디안 언어의 학습 및 검증 데이터셋을 통합하여 마스킹된 언어 모델링(MLM)을 활용한 mBERT 및 XLM-RoBERTa의 태스크 적응형 미세조정.
- 클래스 토큰 표현과 소프트맥스 레이어를 사용해 공격적 언어 분류 작업에 대해 태스크 적응형 미세조정된 모델을 미세조정.
- 최종 예측을 위해 다수결 투표 방식을 활용해 세 개의 mBERT 및 세 개의 XLM-RoBERTa 모델을 앙상블.
- BiLSTM 레이어를 통해 문자 수준, 서브워드 수준, 단어 수준의 임베딩을 연결함으로써 표현 융합을 탐색.
- 기본 초모수를 사용한 Hugging Face의 transformers 라이브러리 활용: 5 에포크 학습, 배치 크기 8, 검증 세트 성능 기반 조기 정지.
- 아블레이션 연구를 위해 indic-trans를 사용해 데이터셋을 번역했지만, 최종 모델에는 사용하지 않았다.
실험 결과
연구 질문
- RQ1마스킹된 언어 모델링을 활용한 태스크 적응형 미세조정이 저자원, 코드 믹스드 드라비디안 언어에서의 공격적 언어 탐지 성능을 향상시키는가?
- RQ2다국어, 코드 믹스드 데이터에 대해 미세조정된 mBERT와 XLM-RoBERTa의 성능은 혼합 스크립트 입력에서 어떻게 비교되는가?
- RQ3문자 수준 및 단어 수준 BiLSTM을 활용한 표현 융합이 다양한 드라비디안 언어에서 모델 성능에 얼마나 기여하는가?
- RQ4입력 형식(현지 문자 vs. 로마자 표기)이 공격적 언어 탐지에서 모델 일반화 및 내구성에 미치는 영향은 어떠한가?
주요 결과
- 태스크 적응형 미세조정으로 모든 세 언어에서 F1 스코어가 1-2%p 절대적 향상되었으며, 특히 말라요람어에서 가장 큰 향상(최대 2%p)을 보였다.
- 앙상블 모델은 카나다어 검증 세트에서 F1 스코어 70.30, 정확도 74.00을 기록해 최고 성능을 달성했다.
- XLM-RoBERTa가 타밀어와 말라요람어에서 mBERT를 능가했으며, 각각 검증 세트에서 F1 스코어 76.94와 96.76를 기록했다.
- 기본 모델은 입력이 완전히 로마자로 변환된 경우에도 강력한 성능 유지를 보여, 스크립트 변형에 대한 내구성을 입증했다.
- 표현 융합은 일부 데이터셋에선 성능 향상을 이끌었지만, 다른 데이터셋에선 성능 저하를 초래해 효과가 맥락에 따라 달라지는 것으로 나타났다.
- 시스템은 EACL 2021 공동 과제에서 카나다어 1위, 말라요람어 2위, 타밀어 3위를 기록하며 최상위 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.