[논문 리뷰] Robust Sentiment Analysis for Low Resource languages Using Data Augmentation Approaches: A Case Study in Marathi
이 논문은 저자원 마라티어를 위한 감성 분석을 향상시키기 위해 4가지 데이터 증강 기법—다시말하기, 역번역, BERT 기반 토큰 교체(이름 있는 실체 및 무작위 마스킹 포함), GPT 기반 텍스트/라벨 생성—을 제안한다. 이는 의미적 다양성을 유지하면서도 감성 분류 성능을 크게 향상시키며, 특히 GPT 기반 라벨 생성 방법이 도메인 내 MahaSent 데이터셋에서 84.35%의 정확도를 기록하여 다양한 도메인 간의 강건성과 일반화 능력을 향상시킨다.
Sentiment analysis plays a crucial role in understanding the sentiment expressed in text data. While sentiment analysis research has been extensively conducted in English and other Western languages, there exists a significant gap in research efforts for sentiment analysis in low-resource languages. Limited resources, including datasets and NLP research, hinder the progress in this area. In this work, we present an exhaustive study of data augmentation approaches for the low-resource Indic language Marathi. Although domain-specific datasets for sentiment analysis in Marathi exist, they often fall short when applied to generalized and variable-length inputs. To address this challenge, this research paper proposes four data augmentation techniques for sentiment analysis in Marathi. The paper focuses on augmenting existing datasets to compensate for the lack of sufficient resources. The primary objective is to enhance sentiment analysis model performance in both in-domain and cross-domain scenarios by leveraging data augmentation strategies. The data augmentation approaches proposed showed a significant performance improvement for cross-domain accuracies. The augmentation methods include paraphrasing, back-translation; BERT-based random token replacement, named entity replacement, and pseudo-label generation; GPT-based text and label generation. Furthermore, these techniques can be extended to other low-resource languages and for general text classification tasks.
연구 동기 및 목표
- 저자원 인디어 언어, 특히 마라티어에서 감성 분석을 위한 레이블이 부족한 문제를 해결한다.
- 기존 마라티어 데이터셋에 합성 데이터를 증강하여 감성 분류 모델의 일반화 능력과 강건성을 향상시킨다.
- 도메인 내 및 도메인 간 감성 분석 시나리오에서 데이터 증강 기법의 효과성을 평가한다.
- 제한된 마라티어 애너테이션 데이터가 존재하는 상황에서도 데이터 증강이 모델 성능을 크게 향상시킬 수 있음을 입증한다.
- 다른 저자원 언어 및 텍스트 분류 작업에 적용 가능한 이식 가능한 프레임워크를 제공한다.
제안 방법
- 구문적으로 다양하지만 감성을 유지하는 문장을 생성하기 위해 BERT 기반의 무작위 토큰 교체 및 이름 있는 실체 교체를 적용하였다.
- 감성 유지와 함께 다양한 복붙 문장을 생성하기 위해 영어를 중간 언어로 사용하여 역번역을 적용하였다.
- GPT 기반 모델을 활용해 합성 텍스트와 해당되는 감성 라벨을 동시에 생성하여 데이터 다양성과 라벨 일관성을 향상시켰다.
- BERT를 사용하여 순차적 마스킹 전략을 구현하여 토큰을 마스킹 또는 마스킹-교체된 토큰으로 대체함으로써 의미적 구조를 유지하였다.
- 증강된 데이터셋에서 BERT 및 GPT 모델을 미세조정하여 도메인 내 및 도메인 간 설정에서 성능을 평가하였다.
- 모델 성능을 비교하기 위해 혼동 행렬과 표준 지표(정확도, F1 점수)를 사용하였다.
실험 결과
연구 질문
- RQ1데이터 증강 기법이 저자원 마라티어 NLP 작업에서 감성 분류 정확도를 크게 향상시킬 수 있는가?
- RQ2역번역, BERT 마스킹, GPT 생성 등의 다양한 데이터 증강 전략이 도메인 간 일반화 능력 향상에 어떻게 기여하는가?
- RQ3예를 들어 GoEmotions에서 학습하고 MahaSent에서 테스트할 경우, 도메인 간 지식 전이가 마라티어 감성 분석 성능 향상에 어느 정도 기여하는가?
- RQ4어느 증강 방법이 MahaSent 데이터셋에서 가장 높은 도메인 내 정확도를 달성하는가?
- RQ5합성 데이터 생성이 감성 극성은 유지하면서 데이터셋의 다양성과 모델의 강건성을 증가시킬 수 있는가?
주요 결과
- GPT 기반 라벨 생성 방법이 MahaSent 테스트 세트에서 가장 높은 도메인 내 정확도 84.35%를 기록하여 모든 다른 방법을 압도했다.
- BERT 기반의 무작위 마스킹 전략은 MahaSent 데이터셋에서 기준 정확도 83.67%에서 84.30%로 향상시켜 데이터 증강의 효과성을 입증했다.
- 도메인 간 성능이 크게 향상되었으며, GoEmotions에서 미세조정한 모델이 MahaSent 테스트 세트에서 73.62%의 정확도를 기록하여 성공적인 지식 전이를 보였다.
- BERT 기반의 이름 있는 실체 교체 방법은 도메인 간 일반화 능력 향상에서 뚜렷한 성과를 보였으며, 다양한 입력 분포 간에서도 모델의 강건성을 높였다.
- GPT 기반 방법 1(라벨 생성)은 GoEmotions 테스트 세트에서 63.20%의 정확도를 기록하여 목표 도메인에서 뛰어난 성능을 보였다.
- 혼동 행렬 분석 결과, 모든 증강 기법에서 클래스별 정밀도와 재현율이 일관되게 향상되었으며, 특히 불균형한 감성 라벨에 대해 두드러진 개선이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.