[논문 리뷰] Overview of Memotion 3: Sentiment and Emotion Analysis of Codemixed Hinglish Memes
이 논문은 힌두어-영어 혼합어(Hinglish) 멤에 대한 다중모odal 감성 및 정서 분석을 위한 공동 과제인 Memotion 3을 제시하며, 10,000건의 샘플이 레이블링된 데이터셋을 제공한다. 참가자들은 CLIP, BERT, ViT 등의 모델을 사용하여 감성 분석에서 최고 F1 스코어 34.41%, 정서 분석에서 79.77%, 정서 강도 분석에서 59.82%를 기록했으며, 코드-믹스드 맥락에서 사자성과 유머 감지가 특히 도전적인 것으로 나타났다.
Analyzing memes on the internet has emerged as a crucial endeavor due to the impact this multi-modal form of content wields in shaping online discourse. Memes have become a powerful tool for expressing emotions and sentiments, possibly even spreading hate and misinformation, through humor and sarcasm. In this paper, we present the overview of the Memotion 3 shared task, as part of the DeFactify 2 workshop at AAAI-23. The task released an annotated dataset of Hindi-English code-mixed memes based on their Sentiment (Task A), Emotion (Task B), and Emotion intensity (Task C). Each of these is defined as an individual task and the participants are ranked separately for each task. Over 50 teams registered for the shared task and 5 made final submissions to the test set of the Memotion 3 dataset. CLIP, BERT modifications, ViT etc. were the most popular models among the participants along with approaches such as Student-Teacher model, Fusion, and Ensembling. The best final F1 score for Task A is 34.41, Task B is 79.77 and Task C is 59.82.
연구 동기 및 목표
- 힌두어-영어(Hinglish) 멤에 대한 감성 및 정서 분석을 위한 다중모달 모델을 개발하고 평가하는 것, 이는 복잡하고 문화적으로 뉘앙스가 농후한 온라인 커뮤니케이션의 한 형태이다.
- 유머, 농담, 문화적 맥락이 해석에 큰 영향을 미치는 코드-믹스드 다중모달 콘텐츠에서 미묘한 감성과 정서를 탐지하는 데 도전하는 것.
- 힌두어-영어와 같은 저자원 언어 쌍에 대해 자동 멤 이해를 촉진하기 위해 기준 데이터셋과 공동 과제를 제공하는 것.
- 현재 모델이 코드-믹스드 멤에서 사자성, 농담, 공격적 콘텐츠를 다루는 데 가지는 한계를 규명하여 기존 NLP 및 비전 시스템의 격차를 드러내는 것.
제안 방법
- 공동 과제는 감성(과제 A), 정서(과제 B), 정서 강도(과제 C)에 대해 레이블링된 10,000건의 Hinglish 멤 데이터셋을 발표하였으며, 각 과제는 별도로 평가되었다.
- 참가자들은 비전 인코더(예: ViT, CLIP)와 텍스트 인코더(예: BERT, RoBERTa)를 조합한 다중모달 아키텍처를 사용하여 이미지-텍스트 쌍을 처리하였다.
- 일반적인 기법으로는 모델 앙상블, 지식 distillation(Student-Teacher), 시각적 및 텍스트적 표현의 라이트 퓨전을 통한 예측의 강건성 향상이 포함되었다.
- 최고 성능을 낸 시스템은 태스크별 헤드 레이어를 갖춘 미세조정된 CLIP 및 BERT 기반 모델을 사용하였으며, 특히 코드-믹스링을 고려한 위치 임베딩 또는 손실 함수 수정 기법을 통합한 경우가 많았다.
- 평가에서는 보류된 테스트 세트에서 F1 스코어를 기반으로 수행되었으며, 감성, 정서, 강도 예측 간 공정한 비교를 보장하기 위해 각 과제별로 별도로 순위를 매겼다.
- 오류 분석을 통해 사자성 및 유머 감지에서 빈번히 발생하는 실패 패턴을 파악하였으며, 특히 코드-믹스드 언어 패턴에 초점을 맞추었다.

실험 결과
연구 질문
- RQ1사자성과 농담이 포함된 코드-믹스드 Hinglish 멤에서 현재의 다중모달 모델이 감성 탐지에 얼마나 효과적인가?
- RQ2Hinglish 멤에서 가장 도전적인 정서 범주들은 무엇이며, 언어적 코드-믹스링과 다중모달 신호는 모델 성능에 어떤 영향을 미치는가?
- RQ3CLIP 및 BERT와 같은 기존 사전 학습 모델이 정서 강도 예측의 맥락에서 저자원, 코드-믹스드 다중모달 데이터에 얼마나 일반화되는가?
- RQ4왜 일부 멤들—특히 농담이나 사자성을 포함한 멤들—모든 참가 모델에 의해 일관되게 잘못 분류되는가?
- RQ5다양한 정서 및 감성 태스크에서 코드-믹스드 멤 이해의 성능을 향상시키기 위해 통합된 베이스라인 모델을 개발할 수 있는가?
주요 결과
- 감성 분류(과제 A)의 최고 F1 스코어는 34.41%였으며, 사자성과 코드-믹스링의 복잡성 고려 시 향상 여지가 크다는 것을 시사한다.
- 정서 분류(과제 B)는 F1 스코어 79.77%로 가장 높은 성능를 기록했으며, '유머'와 '사자성'이 탐지하기 가장 어려운 정서 범주로 나타났다.
- 정서 강도 예측(과제 C)은 최고 F1 스코어 59.82%를 기록했으며, '매우 사자성'과 '매우 유머' 범주가 가장 잘못 분류된 것으로 나타났다.
- 과제 C에서 400건 이상의 멤이 모든 팀에 의해 잘못 분류되었으며, 이는 대부분 코드-믹스드였고, 다중모달 및 언어적 복잡성 모델링에 지속적인 과제가 있음을 시사한다.
- 세 과제 전반에서 베이스라인을 초월한 팀은 NUAA-QMUL-AIIT와 NYCU_TWO 뿐이었으며, 이는 이 다중모달, 코드-믹스드 환경에서 일반화의 어려움을 반영한다.
- 감성(121건), 정서(231건), 강도(421건) 과제에서 잘못 분류된 많은 예시들이 코드-믹스드였으며, 농담이나 사자성과 관련된 것으로 확인되어 이들이 현재 모델의 핵심 실패 요인임을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.