[논문 리뷰] Sexism Prediction in Spanish and English Tweets Using Monolingual and Multilingual BERT and Ensemble Models
이 논문은 스페인어 및 영어 트윗에서 성차별적 콘텐츠 탐지 및 분류를 위한 다국어 및 단국어 BERT 기반 앙상블 시스템을 제안한다. 이는 미세조정된 BERT 모델, 데이터셋 번역을 통한 데이터 증강, 앙상블 전략을 활용한다. 시스템은 EXIST 2021 공동 과제에서 1등을 차지했으며, 성차별 탐지 과제에서 정확도 0.780, F1 점수 0.780을 기록했고, 분류 과제에서는 정확도 0.658, F1-마크로 0.579를 기록했다. 다국어 BERT 기반 모델 대비 각각 F1 점수 3%와 11% 향상되었다.
The popularity of social media has created problems such as hate speech and sexism. The identification and classification of sexism in social media are very relevant tasks, as they would allow building a healthier social environment. Nevertheless, these tasks are considerably challenging. This work proposes a system to use multilingual and monolingual BERT and data points translation and ensemble strategies for sexism identification and classification in English and Spanish. It was conducted in the context of the sEXism Identification in Social neTworks shared 2021 (EXIST 2021) task, proposed by the Iberian Languages Evaluation Forum (IberLEF). The proposed system and its main components are described, and an in-depth hyperparameters analysis is conducted. The main results observed were: (i) the system obtained better results than the baseline model (multilingual BERT); (ii) ensemble models obtained better results than monolingual models; and (iii) an ensemble model considering all individual models and the best standardized values obtained the best accuracies and F1-scores for both tasks. This work obtained first place in both tasks at EXIST, with the highest accuracies (0.780 for task 1 and 0.658 for task 2) and F1-scores (F1-binary of 0.780 for task 1 and F1-macro of 0.579 for task 2).
연구 동기 및 목표
- 다국어 소셜 미디어에서 성차별적 콘텐츠를 식별하고 분류하는 과제를 해결하기 위해, 특히 스페인어 및 영어에서의 성차별적 콘텐츠를 대상으로 한다.
- 단국어 BERT, 데이터 번역, 앙상블 학습 전략을 통합하여 다국어 BERT 기반 모델을 초월하는 성능을 향상시키기 위해 노력한다.
- 다양한 앙상블 구성 방식이 성차별 탐지 및 분류 성능 향상에 미치는 영향을 평가한다.
- 저자원 언어 및 고자원 언어에 걸쳐 성차별 탐지 시스템을 구현하기 위한 확장 가능하고 적응 가능한 프레임워크를 제공한다.
- 전문가가 라벨링한 데이터셋을 사용하여 최신 NLP 기법을 적용한 성차별 식별 및 분류의 기준을 설정한다.
제안 방법
- EXIST 2021 데이터셋을 기반으로 영어 및 스페인어에 대해 단국어 BERT 모델을 미세조정하여 언어 특화 표현 학습을 향상시켰다.
- 다국어 BERT를 기준 모델로 활용하고, 단국어 및 앙상블 모델의 성능과 비교하였다.
- 학습 데이터의 역번역을 적용하여 학습 데이터 크기를 증가시키고 언어 간 일반화 능력을 향상시켰다.
- 다양한 개별 모델의 예측을 조합하는 단순 평균 앙상블 전략을 구현하였으며, 표준화된 레이블 투표 방식도 포함하였다.
- 다양한 추론 실험을 통해 초파rameter를 최적화하고 공식 평가 지표(정확도(과제 1), F1-마크로(과제 2)))를 사용해 모델을 평가하였다.
- 최종 앙상블 모델은 모든 개별 모델과 최적의 표준화된 레이블 값을 조합하여 최종 예측을 도출하였다.
실험 결과
연구 질문
- RQ1다국어 BERT 모델 대비 단국어 BERT 모델을 사용할 경우 성차별 탐지 및 분류 성능이 향상되는가?
- RQ2역번역을 통한 데이터 번역이 저자원 언어 과제에서 모델 성능을 향상시킬 수 있는가?
- RQ3다양한 BERT 변종과 예측 전략을 조합한 앙상블 모델이 개별 모델보다 더 나은 성능을 내는가?
- RQ4성차별 식별 및 분류 과제에서 F1 점수와 정확도를 최대화하기 위한 최적의 앙상블 구성은 무엇인가?
- RQ5초파rameter 선택이 다양한 언어 및 과제 설정에서 모델 성능에 미치는 영향은 어떠한가?
주요 결과
- 모든 개별 모델과 최적의 표준화된 레이블 값을 조합한 최종 앙상블 모델이 가장 높은 성능을 기록하여 EXIST 2021 공동 과제의 두 과제에서 모두 1등을 차지했다.
- 성차별 식별 과제에서 시스템은 정확도 0.780, F1 점수 0.780을 기록했으며, 다국어 BERT 기반 모델 대비 약 3% 높은 F1 점수를 확보했다.
- 성차별 분류 과제에서는 정확도 0.658, F1-마크로 0.579를 기록했으며, 다국어 BERT 기반 모델 대비 F1-마크로에서 약 11% 향상된 성능을 보였다.
- 앙상블 모델은 일관되게 개별 단국어 및 다국어 BERT 모델보다 뛰어난 성능을 보였으며, 이 경우 모델 평균화의 효과가 입증되었다.
- 번역된 학습 데이터의 사용은 특히 저자원 환경에서 모델 일반화 능력을 향상시켰지만, 주요 성과 향상 요인은 앙상블 통합에서 비롯되었다.
- 초파rameter 분석 결과, 레이블 표준화 및 투표 전략이 다중 클래스 분류에서 최종 예측 품질에 상당한 영향을 미쳤다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.