Skip to main content
QUICK REVIEW

[논문 리뷰] PaliGemma: A versatile 3B VLM for transfer

Lucas Beyer, Andreas Steiner|arXiv (Cornell University)|2024. 07. 10.
Advanced Fiber Optic Sensors인용 수 11
한 줄 요약

PaliGemma는 SigLIP-So400m 이미지 인코더와 Gemma-2B 디코더를 결합한, 오픈형의 서브-3B 비전-언어 모델로, VLM 벤치마크, 원격 탐지 및 세분화를 포함한 다양한 오픈 월드 태스크에 걸쳐 전이되도록 학습된 모델이다.

ABSTRACT

PaliGemma is an open Vision-Language Model (VLM) that is based on the SigLIP-So400m vision encoder and the Gemma-2B language model. It is trained to be a versatile and broadly knowledgeable base model that is effective to transfer. It achieves strong performance on a wide variety of open-world tasks. We evaluate PaliGemma on almost 40 diverse tasks including standard VLM benchmarks, but also more specialized tasks such as remote-sensing and segmentation.

연구 동기 및 목표

  • 광범위한 태스크 집합 전반에 걸쳐 잘 전달되는 다목적 베이스 비전-언어 모델을 제공한다.
  • 작고 오픈형 VLM이 표준 및 틈새 태스크에서 더 큰 모델에 근접하거나 이를 능가할 수 있음을 보인다.
  • 다양한 출력을 위한 효과적인 다단계 사전 학습 및 전달 전략을 시연한다.
  • 멀티모달 사전 학습 및 전달 성능에 영향을 주는 설계 선택을 조사한다.
  • 하이퍼파라미터 및 해상도 처리에 대한 가이드라인과 함께 실용적인 전달 레시피를 제시한다.

제안 방법

  • SigLIP 이미지 인코더, Gemma-2B 디코더 LM, 그리고 이미지 토큰을 언어 모델 입력에 연결하는 선형 프로젝션으로 구성된 세 구성요소 VLM을 조립한다.
  • 스테이지드 과정으로 학습한다: Stage0 단일모달 사전학습, Stage1 고정 없이 광범위한 태스크 혼합에서의 멀티모달 사전학습, Stage2 해상도 상승 파인튜닝, Stage3 다양한 벤치마크에 대한 태스크 특정 전달.
  • 접두사-LM 마스킹을 사용하여 입력(이미지 및 접두사)에 대한 전체 어텐션을 허용하고, 후행 생성을 자기회귀로 수행하며, 감독은 접미사에만 적용한다.
  • Gemma 어휘를 1024 위치 토큰과 128 세분화 토큰으로 확장하고, 새로운 토큰을 전이 최적화를 위해 신중하게 초기화한다.
  • 간단한 선형 커넥터를 사용하고 Stage1 동안 이미지 인코더를 고정하지 않아 더 나은 공간 이해와 전달 가능성을 얻는다.
  • 30개 이상 학술 벤치마크에 걸쳐 해상도, 에포크 수, 학습률, 라벨 스무딩, 드롭아웃 등과 같은 태스크 특화 하이퍼파라미터를 포함하는 통합 전달 레시피를 채택하고, 사전학습 데이터에서 이미지가 중복되지 않도록 보장한다.
Figure 1: PaliGemma’s architecture: a SigLIP image encoder feeds into a Gemma decoder LM.
Figure 1: PaliGemma’s architecture: a SigLIP image encoder feeds into a Gemma decoder LM.

실험 결과

연구 질문

  • RQ1대략 3B 매개변수 규모의 작고 개방형 VLM이 더 큰 모델에 비해 광범위한 비전-언어 태스크에서 어떻게 성능을 보이는가?
  • RQ2개방형 VLM의 전달 성능에 가장 크게 영향을 미치는 사전학습 및 학습 설계 선택은 무엇인가?
  • RQ3증가된 이미지 해상도가 연산 또는 데이터의 기하급수적 증가 없이도 Stage 학습으로 전달 가능하게 달성될 수 있는가?
  • RQ4표준 VLM 벤치마크 및 전문 태스크(원격 탐지, 인포그래픽 QA, 세분화, 비디오 태스크)에서 강력한 성능을 내는 실용적인 전달 레시피(하이퍼파라미터, 증강, 아키텍처 선택)는 무엇인가?

주요 결과

  • PaliGemma (3B 규모)가 표준 VLM 벤치마크(예: COCO, VQA, TextVQA)와 전문 태스크(원격 탐지 VQA, 인포그래픽 QA, 비디오 자막 생성, 지칭 표현 분할)에서 경쟁력 있는 성능을 달성한다.
  • 3단계 사전학습 일정(단일모달, 고정 해제된 이미지 인코더를 포함하는 멀티모달, 해상도 상승)으로 다양한 태스크에 대한 광범위한 전달 가능성을 얻는다.
  • 입력 전체 주의와 접미사 자기회귀를 가진 Prefix-LM 마스킹이 대안보다 우수하며, 태스크 접두사가 애매한 태스크에 도움을 주고 접미사만 감독이 효과적이다.
  • 새로운 토큰(위치 토큰과 세분화 토큰)을 추가하는 경우 신중한 초기화가 필요하며(AvgEmb은 장기 전이에는 해로울 수 있음), 일반적인 가우시안 초기화가 더 나은 전달을 낳는다.
  • Stage1에서 이미지 인코더를 고정하지 않는 것이 공간적 이해와 전달 가능성을 높이며, 인코더를 고정하는 것은 성능을 해친다; 이 설정에서 선형 커넥터가 MLP보다 우수하다.
  • 다양한 해상도 체크포인트를 제공하는 것(224, 448, 896)과 Stage2를 통한 재가공은 이로 인해 이점이 있으며, 더 높은 해상도 콘텐츠와 더 긴 시퀀스 길이의 효과가 분리되어 있다.
Figure 2: PaliGemma’s Prefix-LM masking: block attention throughout image and prefix, autoregressive attention on the suffix. Each square indicates whether the row can attend to the column.
Figure 2: PaliGemma’s Prefix-LM masking: block attention throughout image and prefix, autoregressive attention on the suffix. Each square indicates whether the row can attend to the column.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.