[논문 리뷰] Hopeful_Men@LT-EDI-EACL2021: Hope Speech Detection Using Indic Transliteration and Transformers
이 논문은 영어, 타밀어, 말라요람어에서의 희망 언어 감지에 대해 문맥적 임bedding과 최적화된 트랜스포머 모델을 활용한 이중 접근법을 제안한다. 두 번째 접근법—11개의 최적화된 트랜스포머(RoBERTa, ALBERT, IndicBERT)를 통한 앙상블 투표—는 영어에서 가중 F1 점수 0.93, 타밀어에서 0.75, 말라요람어에서 0.49를 기록하여 HopeEDI 데이터셋에서 영어 부문 1위, 타밀어 및 말라요람어 부문 상위 3위를 기록했다.
This paper aims to describe the approach we used to detect hope speech in the HopeEDI dataset. We experimented with two approaches. In the first approach, we used contextual embeddings to train classifiers using logistic regression, random forest, SVM, and LSTM based models.The second approach involved using a majority voting ensemble of 11 models which were obtained by fine-tuning pre-trained transformer models (BERT, ALBERT, RoBERTa, IndicBERT) after adding an output layer. We found that the second approach was superior for English, Tamil and Malayalam. Our solution got a weighted F1 score of 0.93, 0.75 and 0.49 for English,Malayalam and Tamil respectively. Our solution ranked first in English, eighth in Malayalam and eleventh in Tamil.
연구 동기 및 목표
- 다국어 유튜브 댓글에서 희망 언어를 감지하는 것, 특히 타밀어 및 말라요람어와 같은 저자원 언어에서의 감지.
- 인도어 데이터셋에서의 코드 믹싱 문제를 해결하기 위해 이역화 파이프라인을 도입하는 것.
- HopeEDI 데이터셋에 기반한 트랜스포머 기반 모델을 최적화하여 희망 언어 감지 성능을 향상시키는 것.
- 전통적 분류기 모델과 최적화된 트랜스포머를 활용한 앙상블 방법을 비교하여 다국어 희망 언어 감지에 대한 성능을 평가하는 것.
제안 방법
- 전처리 단계에서는 특수문자, 이모티콘, 여유 있는 공백을 제거하고 텍스트를 소문자로 변환하는 작업을 수행했다.
- 언어 감지는 코드 믹싱이 발생한 타밀어 및 말라요람어 데이터에 대해 히우리스틱 기반 접근법을 사용하여, 타밀어/말라요람어 외의 내용은 영어 또는 히누어로 분류했다.
- 이역화는 인도어 텍스트의 코드 믹싱된 요소를 원본 스크립트로 변환하기 위해 indic-transliteration 라이브러리를 활용하여 적용했다.
- 기존 분류기(로지스틱 회귀, 랜덤 포레스트, SVM, LSTM)에 사용하기 위해 BERT, RoBERTa, ALBERT, IndicBERT에서 문맥적 임베딩을 추출했다.
- 최종 예측을 위해 RoBERTa, ALBERT, IndicBERT와 같은 최적화된 트랜스포머 모델을 앙상블하여 다수결 투표 방식을 적용했다.
- 최종 시스템은 평가 지표로 가중 F1 점수를 사용했으며, 모델 성능은 훈련/검증 세트에서 파생된 테스트 분할 세트를 기반으로 평가되었다.
실험 결과
연구 질문
- RQ1최적화된 트랜스포머 모델이 다국어 소셜 미디어 텍스트에서 희망 언어 감지에 있어 전통적 분류기 모델을 능가할 수 있는가?
- RQ2이역화 기법이 코드 믹싱이 발생한 인도어 데이터셋에서 희망 언어 감지 성능 향상에 얼마나 효과적인가?
- RQ3여러 개의 최적화된 트랜스포머 모델을 앙상블하여 다수결 투표 방식을 적용할 경우, 타밀어 및 말라요람어와 같은 저자원 언어에서 감지 성능 향상이 이루어지는가?
- RQ4RoBERTa, ALBERT, IndicBERT와 같은 다양한 사전학습 모델 간의 성능은 영어, 타밀어, 말라요람어 희망 언어 감지에서 어떻게 비교되는가?
주요 결과
- 최적화된 트랜스포머 모델의 앙상블는 영어에서 가장 높은 가중 F1 점수 0.93을 기록하여 모든 다른 방법을 압도했다.
- 타밀어에서는 IndicBERT를 활용한 앙상블 접근법이 가중 F1 점수 0.75를 기록하여 총 14개 시스템 중 8위를 기록했다.
- 말라요람어에서는 앙상블 모델이 가중 F1 점수 0.49를 기록하여 총 14개 시스템 중 11위를 기록했다.
- 두 번째 접근법(최적화된 트랜스포머 모델을 활용한 앙상블 투표)은 모든 세 언어에서 첫 번째 접근법(기존 분류기와 함께 사용한 문맥적 임베딩)을 항상 뛰어넘는 성능을 보였다.
- 영어에서는 RoBERTa-base가 가장 뛰어난 개별 모델 성능을 보였고, 타밀어 및 말라요람어에서는 IndicBERT가 가장 뛰어난 성능을 기록했다.
- 마크로 F1 점수와 가중 F1 점수 간의 격차는 특히 타밀어 및 말라요람어에서 소수의 클래스 예측 정확도가 떨어지는 불균형 문제를 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.