QUICK REVIEW
[논문 리뷰] PaliGemma: A versatile 3B VLM for transfer
Lucas Beyer, Andreas Steiner|arXiv (Cornell University)|2024. 07. 10.
Advanced Fiber Optic Sensors인용 수 11
한 줄 요약
PaliGemma는 SigLIP-So400m 이미지 인코더와 Gemma-2B 디코더를 결합한, 오픈형의 서브-3B 비전-언어 모델로, VLM 벤치마크, 원격 탐지 및 세분화를 포함한 다양한 오픈 월드 태스크에 걸쳐 전이되도록 학습된 모델이다.
ABSTRACT
PaliGemma is an open Vision-Language Model (VLM) that is based on the SigLIP-So400m vision encoder and the Gemma-2B language model. It is trained to be a versatile and broadly knowledgeable base model that is effective to transfer. It achieves strong performance on a wide variety of open-world tasks. We evaluate PaliGemma on almost 40 diverse tasks including standard VLM benchmarks, but also more specialized tasks such as remote-sensing and segmentation.
연구 동기 및 목표
- 광범위한 태스크 집합 전반에 걸쳐 잘 전달되는 다목적 베이스 비전-언어 모델을 제공한다.
- 작고 오픈형 VLM이 표준 및 틈새 태스크에서 더 큰 모델에 근접하거나 이를 능가할 수 있음을 보인다.
- 다양한 출력을 위한 효과적인 다단계 사전 학습 및 전달 전략을 시연한다.
- 멀티모달 사전 학습 및 전달 성능에 영향을 주는 설계 선택을 조사한다.
- 하이퍼파라미터 및 해상도 처리에 대한 가이드라인과 함께 실용적인 전달 레시피를 제시한다.
제안 방법
- SigLIP 이미지 인코더, Gemma-2B 디코더 LM, 그리고 이미지 토큰을 언어 모델 입력에 연결하는 선형 프로젝션으로 구성된 세 구성요소 VLM을 조립한다.
- 스테이지드 과정으로 학습한다: Stage0 단일모달 사전학습, Stage1 고정 없이 광범위한 태스크 혼합에서의 멀티모달 사전학습, Stage2 해상도 상승 파인튜닝, Stage3 다양한 벤치마크에 대한 태스크 특정 전달.
- 접두사-LM 마스킹을 사용하여 입력(이미지 및 접두사)에 대한 전체 어텐션을 허용하고, 후행 생성을 자기회귀로 수행하며, 감독은 접미사에만 적용한다.
- Gemma 어휘를 1024 위치 토큰과 128 세분화 토큰으로 확장하고, 새로운 토큰을 전이 최적화를 위해 신중하게 초기화한다.
- 간단한 선형 커넥터를 사용하고 Stage1 동안 이미지 인코더를 고정하지 않아 더 나은 공간 이해와 전달 가능성을 얻는다.
- 30개 이상 학술 벤치마크에 걸쳐 해상도, 에포크 수, 학습률, 라벨 스무딩, 드롭아웃 등과 같은 태스크 특화 하이퍼파라미터를 포함하는 통합 전달 레시피를 채택하고, 사전학습 데이터에서 이미지가 중복되지 않도록 보장한다.

실험 결과
연구 질문
- RQ1대략 3B 매개변수 규모의 작고 개방형 VLM이 더 큰 모델에 비해 광범위한 비전-언어 태스크에서 어떻게 성능을 보이는가?
- RQ2개방형 VLM의 전달 성능에 가장 크게 영향을 미치는 사전학습 및 학습 설계 선택은 무엇인가?
- RQ3증가된 이미지 해상도가 연산 또는 데이터의 기하급수적 증가 없이도 Stage 학습으로 전달 가능하게 달성될 수 있는가?
- RQ4표준 VLM 벤치마크 및 전문 태스크(원격 탐지, 인포그래픽 QA, 세분화, 비디오 태스크)에서 강력한 성능을 내는 실용적인 전달 레시피(하이퍼파라미터, 증강, 아키텍처 선택)는 무엇인가?
주요 결과
- PaliGemma (3B 규모)가 표준 VLM 벤치마크(예: COCO, VQA, TextVQA)와 전문 태스크(원격 탐지 VQA, 인포그래픽 QA, 비디오 자막 생성, 지칭 표현 분할)에서 경쟁력 있는 성능을 달성한다.
- 3단계 사전학습 일정(단일모달, 고정 해제된 이미지 인코더를 포함하는 멀티모달, 해상도 상승)으로 다양한 태스크에 대한 광범위한 전달 가능성을 얻는다.
- 입력 전체 주의와 접미사 자기회귀를 가진 Prefix-LM 마스킹이 대안보다 우수하며, 태스크 접두사가 애매한 태스크에 도움을 주고 접미사만 감독이 효과적이다.
- 새로운 토큰(위치 토큰과 세분화 토큰)을 추가하는 경우 신중한 초기화가 필요하며(AvgEmb은 장기 전이에는 해로울 수 있음), 일반적인 가우시안 초기화가 더 나은 전달을 낳는다.
- Stage1에서 이미지 인코더를 고정하지 않는 것이 공간적 이해와 전달 가능성을 높이며, 인코더를 고정하는 것은 성능을 해친다; 이 설정에서 선형 커넥터가 MLP보다 우수하다.
- 다양한 해상도 체크포인트를 제공하는 것(224, 448, 896)과 Stage2를 통한 재가공은 이로 인해 이점이 있으며, 더 높은 해상도 콘텐츠와 더 긴 시퀀스 길이의 효과가 분리되어 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.