[논문 리뷰] Deep Learning Brasil at ABSAPT 2022: Portuguese Transformer Ensemble Approaches
이 논문은 IberLEF 2022에서 포르투갈어 기반 감성 분석(ABSAPT) 분야에서 다국어 및 포르투갈어 전용 트랜스포머 기반 앙상블 모델을 사용하여 최신 기술 성과를 달성했다. 문항어 추출(ATE)에는 포르투갈어 및 다국어 데이터로 미세조정한 RoBERTa와 mDeBERTa 모델의 앙상블를 적용하였고, 감성 경향 추출(SOE)에는 PTT5-large 모델의 투표 앙상블를 사용하여 양쪽 작업에서 모두 82.38%의 균형 정확도를 기록하고 새로운 SOTA 성능을 달성하였다.
Aspect-based Sentiment Analysis (ABSA) is a task whose objective is to classify the individual sentiment polarity of all entities, called aspects, in a sentence. The task is composed of two subtasks: Aspect Term Extraction (ATE), identify all aspect terms in a sentence; and Sentiment Orientation Extraction (SOE), given a sentence and its aspect terms, the task is to determine the sentiment polarity of each aspect term (positive, negative or neutral). This article presents we present our participation in Aspect-Based Sentiment Analysis in Portuguese (ABSAPT) 2022 at IberLEF 2022. We submitted the best performing systems, achieving new state-of-the-art results on both subtasks.
연구 동기 및 목표
- IberLEF 2022에서 포르투갈어 기반 감성 분석(ABSAPT) 분야에서 최신 기술 성능을 달성하기 위해.
- 저자원 포르투갈어 텍스트에서 문항어 추출(ATE) 및 감성 경향 추출(SOE) 과제에 도전하기 위해.
- 다국어 및 포르투갈어 전용 사전 학습된 트랜스포머 모델을 활용하여 두 하위 작업의 성능을 향상시키기 위해.
- 앙상블 전략 및 데이터 증강 기법을 탐색하여 클래스 불균형 문제를 완화하고 일반화 능력을 향상시키기 위해.
제안 방법
- ATE에 대해 저자들은 포르투갈어 데이터셋에 대해 BIO 태깅을 적용한 RoBERTa-PT-base 및 mDeBERTa-base 모델을 미세조정하였으며, MAMs, Evalita, Semeval 등의 외부 다국어 데이터를 활용하였다.
- 최종 ATE 모델은 세 개의 최상위 성능 모델의 중앙값 앙상블를 사용하여 토큰별 레이블 확률을 집계하였다.
- SOE에 대해선 최고 성능을 보인 시스템이 PTT5-large를 사용한 조건부 텍스트 생성 방식을 적용하여 각 문항어에 대해 감성 레이블을 생성하도록 유도하였다.
- SOE 앙상블는 생성된 레이블에 대해 투표 전략을 사용하여 다수의 PTT5-large 모델 예측을 통합하였다.
- GPT-3를 프롬프팅하기 전에 리뷰에 번역을 적용하지 않았으며, 미세조정 없이 제로샷 추론를 통해 소수 샘플 능력을 평가하였다.
- 문장 수준 추출 대신 전체 리뷰와 문항어를 포함한 리뷰 수준 입력을 사용하여 두 작업 모두에서 맥락을 유지하였다.

실험 결과
연구 질문
- RQ1다국어 및 포르투갈어 전용 트랜스포머 기반 앙상블 모델이 포르투갈어 ATE 및 SOE에서 단일 모델 기반 베이스라인을 능가할 수 있는가?
- RQ2GPT-3 및 PTT5와 같은 대규모 언어 모델을 사용한 제로샷 및 소수 샘플 프롬프팅 전략은 저자원 포르투갈어 ABSA에서 얼마나 효과적인가?
- RQ3PTT5-large 모델의 투표 앙상블 전략이 개별 모델 예측에 비해 감성 분류 성능을 향상시키는가?
- RQ4데이터 불균형과 문항어 분포가 포르투갈어 ABSA에서 모델 일반화에 얼마나 영향을 미치는가?
- RQ5동일 작업에 대해 전통적인 분류 미세조정 방식에 비해 조건부 텍스트 생성 방식이 SOE에서 슈퍼리어한 성능을 낼 수 있는가?
주요 결과
- 최종 ATE 제출 결과는 67.14%의 정확도를 기록하여 모든 다른 팀을 압도하고 ABSAPT 2022 벤치마크에서 새로운 SOTA 기록을 수립하였다.
- SOE 시스템은 82.38%의 균형 정확도, 81.80%의 F1 점수, 81.31%의 정밀도를 기록하여 대회에서 모든 팀 중 1위를 차지하였다.
- RoBERTa-PT-base 및 mDeBERTa-base 모델의 앙상블는 다국어 데이터로 훈련된 경우 ATE 성능이 가장 높았으며, F1 점수는 85.9%에 달했다.
- 외부 데이터 없이 PTT5-large는 세 개의 테스트 서브셋 중 두 개에서 최고의 SOE 성능을 기록하였으며, 서브셋 1에서는 86.8%의 정확도를 기록하였다.
- 제로샷 GPT-3 추론는 미세조정 없이도 80.0%의 정확도와 66.0%의 F1 점수를 기록하여 강력한 소수 샘플 능력을 입증하였다.
- 문항어를 포함한 전체 리뷰 입력을 사용함으로써 문장 수준 추출 대비 SOE 성능 향상이 이루어졌으며, 이는 맥락적 신호를 유지했기 때문이다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.