[논문 리뷰] PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models
PEVL은 검출기 없는 시각-언어 미리 훈련(VLP)을 위한 통합된 언어 모델링 프레임워크를 제안하며, 이는 이산적 객체 위치를 텍스트 토큰과 통합하여 명시적인 객체 위치 모델링을 가능하게 한다. 일반화된 마스킹 언어 모델링(GMLM) 목적함수와 유연한 프롬프트 튜닝을 통해 달성되며, 참조 표현 이해 및 어휘 지목과 같은 위치 민감한 작업에서 최고 성능을 기록한다. 또한 지도 입력이 있는 위치 민감하지 않은 작업에서도 성능 향상을 이룬다.
Vision-language pre-training (VLP) has shown impressive performance on a wide range of cross-modal tasks, where VLP models without reliance on object detectors are becoming the mainstream due to their superior computation efficiency and competitive performance. However, the removal of object detectors also deprives the capability of VLP models in explicit object modeling, which is essential to various position-sensitive vision-language (VL) tasks, such as referring expression comprehension and visual commonsense reasoning. To address the challenge, we introduce PEVL that enhances the pre-training and prompt tuning of VLP models with explicit object position modeling. Specifically, PEVL reformulates discretized object positions and language in a unified language modeling framework, which facilitates explicit VL alignment during pre-training, and also enables flexible prompt tuning for various downstream tasks. We show that PEVL enables state-of-the-art performance of detector-free VLP models on position-sensitive tasks such as referring expression comprehension and phrase grounding, and also improves the performance on position-insensitive tasks with grounded inputs. We make the data and code for this paper publicly available at https://github.com/thunlp/PEVL.
연구 동기 및 목표
- 검출기 없는 시각-언어 미리 훈련(VLP) 모델에서 명시적인 객체 위치 모델링의 부재로 인해 위치 민감한 작업에서 성능이 저하되는 문제를 해결하기 위해.
- 시각적 객체 위치와 언어 토큰을 하나의 언어 모델링 프레임워크 내에서 통합하여 공동 미리 훈련과 유연한 프롬프트 튜닝을 가능하게 하기 위해.
- 동일한 GMLM 헤드를 다양한 최종 작업에 걸쳐 프롬프트 튜닝에 재사용함으로써 미리 훈련과 미세조정 간 격차를 줄이기 위해.
- 이산화로 인한 공간 순서 손실을 방지하기 위해 근접한 위치에 높은 소프트 레이블을 할당하는 순서 인식 목적함수를 도입함으로써 위치 학습의 강건성을 향상시키기 위해.
제안 방법
- 객체 경계 상자 좌표를 이산적 위치 토큰으로 변환하고, 해당 객체 기술 토큰 뒤에 이들을 연결하여 입력 시퀀스에 삽입한다.
- 모델이 교차 모odal 맥락에서 마스킹된 텍스트 및 위치 토큰을 예측하는 일반화된 마스킹 언어 모델링(GMLM) 작업으로 미리 훈련을 설정한다.
- 이산화로 인한 손실을 방지하기 위해 근접한 위치에 높은 소프트 레이블을 할당하는 순서 인식 목적함수를 도입하여 위치 토큰 재구성에 활용한다.
- 동일한 GMLM 헤드를 사용하여 최종 VL 작업을 빈 칸 채우기 문제로 재구성함으로써 프롬프트 튜닝을 가능하게 하여, 미리 훈련과 미세조정 간 분포 이격을 최소화한다.
- 모든 작업에서 일관성을 유지하기 위해 공유된 트랜스포머 인코더-디코더 아키텍처를 사용하여, 위치 입력 및 위치 출력 작업을 모두 지원한다.
- BERT와 동일하게 텍스트 및 위치 토큰에 동일한 마스킹 비율을 유지함으로써, 미리 훈련 중 균형 잡힌 학습을 보장한다.
실험 결과
연구 질문
- RQ1검출기 없이도 명시적인 객체 위치 모델링이 검출기 없는 시각-언어 미리 훈련에 효과적으로 통합될 수 있는가?
- RQ2이산적 위치 토큰이 공간 순서를 유지하고 애너테이션 노이즈에 강건하게 유지될 수 있도록 어떻게 모델링할 수 있는가?
- RQ3통합된 GMLM 프레임워크는 언어와 위치 표현을 공동으로 미리 훈련하면서도 다양한 시각-언어 작업에 대해 민감한 프롬프트 튜닝을 가능하게 할 수 있는가?
- RQ4제안된 위치 재구성에 대한 순서 인식 목적함수는 표준 마스킹 대비 국소화 및 추론 성능 향상에 기여하는가?
- RQ5동일한 GMLM 헤드가 위치 민감한 작업과 위치 민감하지 않은 작업 모두에 효과적으로 재사용되어 미리 훈련과 미세조정 간 격차를 줄일 수 있는가?
주요 결과
- PEVL은 검출기 없는 VLP 모델 중에서 참조 표현 이해 및 어휘 지목 작업에서 최고 성능을 기록하며, 명시적인 위치 모델링이 없는 이전 방법들을 능가한다.
- 표 7에 나타나 있듯이, 제안된 순서 인식 목적함수는 중간 단계의 미리 훈련 동안 RefCOCO에서 더 빠른 수렴과 향상된 성능을 이끌어냈다.
- 지도 입력이 있는 경우 시각적 질의 응답과 같은 위치 민감하지 않은 작업에서 성능 향상을 기록하여, 향상된 강건성과 일반화 능력을 입증했다.
- 소형 객체에 대해 강력한 국소화 결과를 달성하여, 회귀 기반 모델과 비교해도 유사한 성능을 보였다. 그림 2에 시각화되어 있다.
- 제거 분석 결과, 높은 마스킹 비율과 마스킹된 위치의 포괄적 커버리지는 효과적인 위치 학습에 필수적임을 확인했다.
- 공유된 GMLM 헤드를 가진 통합된 프롬프트 튜닝 프레임워크는 다양한 최종 작업에 대해 일관되고 효과적인 적응을 가능하게 하여, 미리 훈련과 미세조정 간 분포 이격을 최소화한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.