[논문 리뷰] Vision-and-Language Pretrained Models: A Survey
이 종합 검토는 시각-언어 사전 훈련 모델(VLPMs)에 대한 포괄적인 개요를 제공하며, 아키텍처, 입력 인코딩 방법, 사전 훈련 및 미세조정 전략, 그리고 후행 작업을 상세히 다룬다. 다중 모odal 트랜스포머가 공동의 시각-언어 표현을 학습하는 데서 수행하는 역할을 강조하고, 교차 모달 정렬, 다중 작업 사전 훈련, 훈련 평가 등 향후 방향성과 주요 과제를 규명한다. 모델의 효율성과 성능 향상을 위해 개선이 필요한 분야를 제시한다.
Pretrained models have produced great success in both Computer Vision (CV) and Natural Language Processing (NLP). This progress leads to learning joint representations of vision and language pretraining by feeding visual and linguistic contents into a multi-layer transformer, Visual-Language Pretrained Models (VLPMs). In this paper, we present an overview of the major advances achieved in VLPMs for producing joint representations of vision and language. As the preliminaries, we briefly describe the general task definition and genetic architecture of VLPMs. We first discuss the language and vision data encoding methods and then present the mainstream VLPM structure as the core content. We further summarise several essential pretraining and fine-tuning strategies. Finally, we highlight three future directions for both CV and NLP researchers to provide insightful guidance.
연구 동기 및 목표
- 컴퓨터 비전과 자연어 처리 분야의 연구자들을 대상으로 시각-언어 사전 훈련 모델(VLPMs)에 대한 체계적이고 종합적인 검토를 제공하기 위해.
- VLPM의 핵심 구성 요소인 입력 인코딩, 상호작용 모델링, 사전 훈련 전략을 식별하고 분석하기 위해.
- 주류 VLPM 아키텍처와 다양한 시각-언어 작업에서의 성능을 요약하기 위해.
- 교차 모달 정렬, 다중 작업 사전 훈련, 훈련 평가 분야에서의 열린 과제를 부각하고 향후 연구 방향을 제안하기 위해.
제안 방법
- 논문은 일반적인 4단계 아키텍처를 기반으로 주요 VLPM을 검토한다: 시각/언어 원시 입력, 모odal별 표현 학습, 트랜스포머 내 다중 헤드 자기주의를 통한 시각-언어 상호작용, 공동의 교차 모달 표현 출력.
- BERT 스타일의 입력 표현을 사용한 언어 인코딩을 분석하며, 토큰, 위치, 세그먼트 임베딩을 포함하고, 모달 특화 및 초기 융합 전략(예: 입력 또는 표현 수준에서의 V2L)을 포함한다.
- 영역 기반 특징(예: RoI 특징)을 사용한 시각 인코딩과 트랜스포머 인코더 내 텍스트 임베딩과의 통합을 검토한다.
- 쌍화된 이미지-텍스트 데이터에 적용된 사전 훈련 목표를 검토한다: 마스크된 언어 모델링, 대비 학습, 마스크된 이미지 모델링.
- 다양한 후행 작업에서의 미세조정 전략을 평가한다: VQA, 이미지 캡션 생성, 시각적 기반, 시각-언어 탐색.
- 향후 연구 방향을 제안하며, 개선된 교차 모달 정렬, 단계적 및 다중 작업 사전 훈련, 훈련 시간 평가 지표에 중점을 둔다.
실험 결과
연구 질문
- RQ1다중 모달 트랜스포머를 사용할 때 시각-언어 사전 훈련 모델은 이미지와 텍스트의 공동 표현을 어떻게 학습하는가?
- RQ2최신 VLPM에서 주로 사용되는 아키텍처와 입력 인코딩 전략는 무엇인가?
- RQ3사전 훈련 목표와 미세조정 전략은 다양한 시각-언어 작업에서의 성능에 어떤 영향을 미치는가?
- RQ4교차 모달 정렬에서의 주요 과제는 무엇이며, 어떻게 해결할 수 있는가?
- RQ5모델의 효율성, 일반화 능력, 평가 방식 향상을 위한 향후 방향은 무엇인가?
주요 결과
- 다중 헤드 자기주의를 갖춘 BERT 스타일의 트랜스포머 아키텍처를 기반으로 한 VLPM은 시각 및 언어 표현 간의 교차 모달 상호작용을 효과적으로 모델링한다.
- 시각적 특징을 언어 입력에 조기에 융합함(예: 개체 태그를 통한)으로써 시각-언어 작업에서의 정렬과 성능 향상이 향상된다.
- 도메인 내 데이터셋에서 사전 훈련하면, 특히 오픈 어휘 및 생성 작업에서 더 작은 데이터셋이라도 후행 작업에서 더 좋은 성능을 내는 경향이 있다.
- 12-in-1과 같은 다중 작업 사전 훈련 전략은 내부 및 그룹 간 작업의 상호보완적 효과를 통해 성능 향상을 보이나, 최적의 작업 조합 및 순서는 아직 열려 있는 과제이다.
- 훈련 시간 평가 지표(예: 퍼플렉서티)는 모델 결함을 조기에 탐지하고 후행 계산 낭비를 줄이는 데 도움이 될 수 있다.
- 다양하고 대규모의 쌍화된 이미지-텍스트 데이터에서 사전 훈련된 모델은 다양한 시각-언어 벤치마크에서 강력한 zero-shot 및 미세조정 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.