[논문 리뷰] VLP: A Survey on Vision-Language Pre-training
이 종합 검토는 시각-언어 사전 훈련(VLP)의 포괄적인 개요를 제공하며, 특징 추출, 모델 아키텍처, 사전 훈련 목표, 데이터셋, 그리고 후행 작업을 포함한다. 이 논문은 최신 VLP 모델을 체계적으로 검토하고, 프롬프트 튜닝, 모델 압축, 도메인 외 사전 훈련, 디퓨전 모델 및 기하학적 딥 러닝과 같은 새로운 아키텍처와 같은 부상 중인 분야를 규명한다.
In the past few years, the emergence of pre-training models has brought uni-modal fields such as computer vision (CV) and natural language processing (NLP) to a new era. Substantial works have shown they are beneficial for downstream uni-modal tasks and avoid training a new model from scratch. So can such pre-trained models be applied to multi-modal tasks? Researchers have explored this problem and made significant progress. This paper surveys recent advances and new frontiers in vision-language pre-training (VLP), including image-text and video-text pre-training. To give readers a better overall grasp of VLP, we first review its recent advances from five aspects: feature extraction, model architecture, pre-training objectives, pre-training datasets, and downstream tasks. Then, we summarize the specific VLP models in detail. Finally, we discuss the new frontiers in VLP. To the best of our knowledge, this is the first survey focused on VLP. We hope that this survey can shed light on future research in the VLP field.
연구 동기 및 목표
- 컴퓨터 비전 및 자연어 처리 분야의 연구자들을 대상으로 시각-언어 사전 훈련(VLP)에 대한 체계적이고 종합적인 검토를 제공하기 위해.
- 특징 추출, 모델 아키텍처, 사전 훈련 목표, 데이터셋, 후행 작업 등 VLP의 핵심 구성 요소를 식별하고 분석하기 위해.
- 최신 VLP 모델을 요약하고, 그들의 아키텍처적 및 목표적 혁신을 부각하기 위해.
- 프롬프트 튜닝, 모델 압축, 도메인 외 사전 훈련, 새로운 아키텍처와 같은 VLP의 부상 중인 분야를 탐색하기 위해.
- 현재 분야의 상태를 통합하고 열려 있는 과제를 규명하여 향후 연구의 기초 자료로 기여하기 위해.
제안 방법
- 객체 검출 기반 영역 특징과 CLIP 스타일 이미지 인코더를 포함한 특징 추출 기법에 기반해 VLP 모델를 분류한다.
- 단일 스트림 대비 이중 스트림, 인코더 전용 대비 인코더-디코더 구성으로 모델 아키텍처를 분류한다.
- 완성, 매칭, 시간적, 그리고 마스크된 언어 모델링과 같은 특수 목표를 포함한 4가지 주요 사전 훈련 목표를 검토한다.
- COCO, Conceptual Captions, MS-COCO와 같은 주요 사전 훈련 데이터셋을 수집하고 분석하며, 그 규모와 모odal 커버리지에 중점을 둔다.
- 이미지 캡션 생성, 시각적 질의 응답, 비디오-언어 이해와 같은 후행 작업을 검토하며, 평가 목표를 상세히 기술한다.
- 효율성과 일반화를 향상시키기 위한 프롬프트 튜닝, 지식 정복, 모델 양자화와 같은 새로운 기법을 탐색한다.
실험 결과
연구 질문
- RQ1현대 시각-언어 사전 훈련 모델의 핵심 구성 요소와 설계 선택 사항은 무엇인가?
- RQ2다양한 사전 훈련 목표는 시각과 언어 간의 교차 모odal 정렬 학습을 어떻게 이끌어내는가?
- RQ3가장 영향력 있는 VLP 모델들은 무엇이며, 어떤 아키텍처적 또는 목표적 혁신을 도입하는가?
- RQ4효율성, 일반화 및 인지 통합 측면에서 VLP의 주요 과제와 열려 있는 연구 방향은 무엇인가?
- RQ5프롬프트 튜닝 및 지식 통합과 같은 새로운 기법은 VLP 모델의 성능과 적응 가능성 향상에 어떻게 기여할 수 있는가?
주요 결과
- 이 연구는 시각-언어 사전 훈련에 전적으로 집중한 최초의 종합 검토로, 특징 추출, 모델 설계, 목표, 데이터셋, 후행 작업에 걸친 기술 발전을 통합한다.
- 객체 검출 기반 영역 특징(Faster R-CNN 등)과 CLIP 스타일의 대비 학습이 특징 추출에서 지배적이다. 후자는 제로샷 일반화를 가능하게 한다.
- 인코더 전용 및 인코더-디코더 아키텍처가 널리 사용되며, 모odal별 처리가 필요한 작업에서는 이중 스트림 모델이 단일 스트림 모델보다 일반적으로 뛰어난 성능을 보인다.
- 마스크된 언어 모델링, 대비 학습, 마스크된 영역 모델링과 같은 사전 훈련 목표는 교차 모달 정렬 학습에 핵심적인 역할을 한다.
- 최근의 모델들인 VATT와 OPT는 다수준 마스크링 및 생성 기능을 통해 텍스트, 이미지, 오디오의 공동 사전 훈련 가능성을 입증한다.
- 프롬프트 튜닝, 지식 통합, 모델 압축과 같은 부상 중인 분야는 VLP에서 효율성, 일반화 및 확장성 향상에 강력한 잠재력을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.