[논문 리뷰] VAuLT: Augmenting the Vision-and-Language Transformer for Sentiment Classification on Social Media
VAuLT는 대규모 언어 모델(예: BERT)을 통합하여 비전-언어 트랜스포머(ViLT)의 언어 표현을 향상시켜 소셜 미디어에서 감성 분류 작업에서 성능을 크게 향상시킨다. 이 방법은 엔드 투 엔드 공동 미세조정을 통해 훈련 및 추론 효율성에 거의 영향을 주지 않으면서, TWITTER-2015, TWITTER-2017, MVSA-Single, MVSA-Multiple에서 최신 기술(SOTA) 성능을 달성하며, ViLT 대비 최대 20%의 상대적 성능 향상을 기록한다.
We propose the Vision-and-Augmented-Language Transformer (VAuLT). VAuLT is an extension of the popular Vision-and-Language Transformer (ViLT), and improves performance on vision-and-language (VL) tasks that involve more complex text inputs than image captions while having minimal impact on training and inference efficiency. ViLT, importantly, enables efficient training and inference in VL tasks, achieved by encoding images using a linear projection of patches instead of an object detector. However, it is pretrained on captioning datasets, where the language input is simple, literal, and descriptive, therefore lacking linguistic diversity. So, when working with multimedia data in the wild, such as multimodal social media data, there is a notable shift from captioning language data, as well as diversity of tasks. We indeed find evidence that the language capacity of ViLT is lacking. The key insight and novelty of VAuLT is to propagate the output representations of a large language model (LM) like BERT to the language input of ViLT. We show that joint training of the LM and ViLT can yield relative improvements up to 20% over ViLT and achieve state-of-the-art or comparable performance on VL tasks involving richer language inputs and affective constructs, such as for Target-Oriented Sentiment Classification in TWITTER-2015 and TWITTER-2017, and Sentiment Classification in MVSA-Single and MVSA-Multiple. Our code is available at https://github.com/gchochla/VAuLT.
연구 동기 및 목표
- 간단한 이미지 캡션으로 사전학습된 ViLT의 언어 능력이 제한되어 있어, 감정이 강하고 복잡한 소셜 미디어 텍스트에서 성능이 열 劣하는 문제를 해결하기 위해.
- 언어가 다양하고 미묘하며 종종 비유적이거나 아이러니컬한 소셜 미디어 환경에서 다중모달 감성 분류를 향상시키기 위해.
- 비싼 객체 탐지기 없이도 훈련 및 추론 효율성을 유지하면서 언어 이해력을 향상시키기 위해.
- 사전학습된 언어 모델이 캡션 데이터셋과 실제 소셜 미디어 입력 간의 도메인 차이를 메우는 데 기여할 수 있는지 조사하기 위해.
- 특히 감정 분석 작업에서 깊이 있는 언어 인코더와 깊이 있는 시각 인코더의 기여도를 평가하기 위해.
제안 방법
- VAuLT는 ViLT의 표준 언어 임bedding 레이어를 대체하여 대규모 사전학습된 언어 모델(예: BERT)의 문맥 기반 표현을 사용하며, 이를 ViLT 인코더에 입력한다.
- 언어 모델과 ViLT를 엔드 투 엔드 공동 미세조정하여, 향상된 언어 특징과 비전-언어 표현 공간 간의 정렬을 가능하게 한다.
- 시각 입력은 선형 투영된 이미지 패치를 통해 처리되어 ViLT의 계산 효율성을 유지한다.
- 이 방법은 모듈러하다: 언어 모델은 특징 추출기 역할을 하며, 그 출력은 핵심 아키텍처를 수정하지 않고 ViLT의 입력 임베딩 레이어에 통합된다.
- 실험은 VAuLT, ViLT, 동결된 언어 모델 버전, 깊이 있는 시각 인코더를 갖춘 모델들(예: TomViLT, TomVAuLT)을 비교하여 깊이 있는 언어 모델링의 기여도를 분리한다.
- 이 방법은 감정 언어와 다중모달 감성을 포함한 여러 벤치마크에서 평가된다: TWITTER-2015, TWITTER-2017, MVSA-Single, MVSA-Multiple.
실험 결과
연구 질문
- RQ1사전학습된 언어 모델을 통해 ViLT의 언어 표현을 향상시키면, 언어가 복잡하고 다양한 소셜 미디어에서 감성 분류 성능이 크게 향상되는가?
- RQ2언어 모델과 ViLT를 공동으로 미세조정하는 것이, ViLT만을 미세조정하거나 동결된 언어 모델을 사용하는 것보다 더 나은 성능을 내는가?
- RQ3다중모달 모델의 성능은 특히 감정 분석 작업에서 언어 인코더와 시각 인코더의 깊이에 따라 어떻게 달라지는가?
- RQ4심층적인 재학습 없이도 사전학습된 언어 모델이 캡션 데이터셋과 실제 소셜 미디어 데이터 간의 분포 차이를 메울 수 있는가?
- RQ5다중모달 감성 분류에서 깊이 있는 언어 인코더가 깊이 있는 시각 인코더보다 우월하거나 갈등을 일으키는가?
주요 결과
- VAuLT는 감성 분류 작업에서 ViLT 대비 20%의 상대적 향상을 기록하며, 향상된 언어 표현의 효과를 입증한다.
- 언어 모델과 ViLT의 공동 미세조정이 필수적이다. 동결된 언어 모델을 사용할 경우 ViLT와 동등하거나 그 이하의 성능을 보인다.
- TWITTER-2015에서 VAuLT는 75.0% 정확도와 69.0% 매크로-F1을 기록하여 ViLT(69.6% 및 60.3%)와 TomViLT(73.2% 및 66.1%)를 모두 초월한다.
- TWITTER-2017에서 VAuLT는 67.8% 정확도와 64.9% 매크로-F1을 기록하여 ViLT(64.0% 및 58.0%)와 TomViLT(67.3% 및 64.4%)를 모두 뛰어넘는다.
- TomVAuLT와 TomViLT의 실험 결과, 깊이 있는 언어 인코더가 존재할 경우 깊이 있는 시각 인코더가 성능을 떨어뜨리는 것으로 나타나, 강력한 시각 인코더가 반드시 필요하다는 기존의 가정을 도전한다.
- VAuLT는 MVSA-Single 및 MVSA-Multiple를 포함한 모든 평가 벤치마크에서 최신 기술 또는 경쟁 가능한 성능을 달성하며, 계산 오버헤드를 최소한도로 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.