[논문 리뷰] indicnlp@kgp at DravidianLangTech-EACL2021: Offensive Language Identification in Dravidian Languages
이 논문은 번역된 드라비디아어 언어(타밀-영어, 말라요람-영어, 칸나다-영어)에서의 공격적 언어 식별을 위한 최신 기술 기반 앙상블 시스템을 제시한다. 이는 다국어 BERT와 RoBERTa를 사용한 전이 학습 기반으로, 추가적인 단일 언어 영어 공격적 언어 데이터(OLID)로 미세조정된 모델을 활용한다. 이 방법은 각각의 데이터셋에서 가중 F1 점수 0.77, 0.97, 0.72로 1위, 2위, 3위를 기록하였다.
The paper presents the submission of the team indicnlp@kgp to the EACL 2021 shared task "Offensive Language Identification in Dravidian Languages." The task aimed to classify different offensive content types in 3 code-mixed Dravidian language datasets. The work leverages existing state of the art approaches in text classification by incorporating additional data and transfer learning on pre-trained models. Our final submission is an ensemble of an AWD-LSTM based model along with 2 different transformer model architectures based on BERT and RoBERTa. We achieved weighted-average F1 scores of 0.97, 0.77, and 0.72 in the Malayalam-English, Tamil-English, and Kannada-English datasets ranking 1st, 2nd, and 3rd on the respective tasks.
연구 동기 및 목표
- 저자원, 코드 믹스 드라비디아어 언어 데이터셋에서의 공격적 언어 식별 과제를 해결하기 위해.
- 전이 학습과 외부 단일 언어 데이터를 활용하여 저자원 환경에서의 모델 일반화를 향상시키기 위해.
- RNN과 트랜스포머 아키텍처를 조합한 앙상블 모델의 효과성을 다국어 공격적 언어 식별에 대해 조사하기 위해.
- 전이 학습을 통한 데이터 증강이 코드 믹스 텍스트에 대한 다국어 BERT와 RoBERTa의 성능에 미치는 영향을 평가하기 위해.
- EACL 2021 공동 과제인 드라비디아어 언어에서의 공격적 언어 식별에 경쟁적으로 순위를 확보하기 위해.
제안 방법
- 전이 학습을 활용하여 코드 믹스 드라비디아어 데이터셋에 대해 다국어 BERT(mBERT)와 XLM-RoBERTa(XLM-R) 모델을 미세조정하였다.
- 일반화 향상과 클래스 불균형 완화를 위해 드라비디아어 코드 믹스 데이터셋과 단일 언어 OLID 데이터셋(14,000개의 영어 트윗)을 결합하였다.
- 정지어 제거, 표준화, 이모지 설명으로의 치환, 상관도 기반 특성 선택을 포함한 데이터 전처리를 적용하였다.
- 도메인 특화 데이터에서 언어 모델 미세조정을 통해 ULMFiT를 활용한 전이 학습을 수행한 AWD-LSTM 모델을 훈련시켰다.
- 트랜스포머 모델의 마지막 레이어 은닉 상태에서 최대 풀링 및 평균 풀링을 연결하여 문장 표현을 구성하였다.
- 최고 성능을 보인 XLM-R, mBERT, ULMFiT 모델의 예측을 평균화하여 최종 추론을 위한 앙상블 모델을 구축하였다.
실험 결과
연구 질문
- RQ1단일 언어 영어 공격적 언어 데이터(OLID)에서의 전이 학습이 저자원 코드 믹스 드라비디아어 언어 데이터셋에서의 성능 향상에 기여하는가?
- RQ2외부 데이터와 함께 결합된 드라비디아어 코드 믹스 데이터에 대해 미세조정된 다국어 트랜스포머 모델(mBERT, XLM-R)의 성능는 어떠한가?
- RQ3다양한 아키텍처(RNN, BERT, RoBERTa) 간의 앙상블 학습이 공격적 언어 식별에서 강건성과 성능 향상에 얼마나 기여하는가?
- RQ4더 큰, 통합된 드라비디아어 코드 믹스 텍스트 데이터셋에 대해 미세조정하면, 저자원 언어로의 제로샷 또는 피처샷 전이 성능이 향상되는가?
- RQ5다양한 전처리 전략(예: 이모지 치환, 표준화)이 코드 믹스 소셜 미디어 텍스트에서의 모델 성능에 어떤 영향을 미치는가?
주요 결과
- 앙상블 모델은 타밀-영어 데이터셋에서 가중 F1 점수 0.77을 기록하여 공동 과제에서 1위를 차지하였다.
- 모델은 말라요람-영어 데이터셋에서 가중 F1 점수 0.97을 기록하여 2위를 확보하였다.
- 모델은 칸나다-영어 데이터셋에서 가중 F1 점수 0.72를 기록하여 총 3위를 기록하였다.
- OLID 데이터셋을 활용한 전이 학습은 특히 더 작은 칸나다-영어 데이터셋에서 성능 향상에 크게 기여하였다.
- 결합된 데이터로 미세조정된 XLM-RoBERTa 모델은 모든 세 데이터셋에서 가장 높은 F1 점수를 기록하여 mBERT와 ULMFiT를 앞섰다.
- XLM-R, mBERT, ULMFiT 모델의 앙상블은 가장 강건하고 높은 성능을 보였으며, 저자원 환경에서 모델 다양성의 이점을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.