[논문 리뷰] What Makes for Good Visual Tokenizers for Large Language Models?
이 논문은 다중모态 대규모 언어 모델(MLLMs)을 위한 시각적 토크나이저를 조사하며, 자기지도 학습 모델이 세분화된 인식에서는 뛰어나지만, 지도 학습 모델이 의미를 더 잘 유지함을 발견한다. 저자들은 마스크 없이 CLIP 패치 특징을 토대로 특징 정제를 수행하는 GVT라는 시각적 토크나이저를 제안하여, 파rameter 증가 없이도 또는 작업별 특화 튜닝 없이도 VQA, 이미지 캡션 생성, 객체 수세기, 다중 클래스 식별 등에서 최고 성능을 달성한다.
We empirically investigate proper pre-training methods to build good visual tokenizers, making Large Language Models (LLMs) powerful Multimodal Large Language Models (MLLMs). In our benchmark, which is curated to evaluate MLLMs visual semantic understanding and fine-grained perception capabilities, we discussed different visual tokenizers pre-trained with dominant methods (i.e., DeiT, CLIP, MAE, DINO), and observe that: i) Fully/weakly supervised models capture more semantics than self-supervised models, but the gap is narrowed by scaling up the pre-training dataset. ii) Self-supervised models are better at fine-grained perception, where patch-level supervision is particularly effective. iii) Tuning the visual tokenizer leads to the loss of semantics obtained from large-scale pretraining, which is unfavorable with relatively small-scale instruction-tuning dataset. Given the findings, we reviewed methods that attempted to unify semantics and fine-grained visual understanding, e.g., patch-level feature distillation with semantically-rich targets. We obtain an intriguing insight mask-based strategies that were once all the rage may not be applicable for obtaining good visual tokenizers. Based on this critical observation, we obtain a new MLLM equipped with a tailored Good Visual Tokenizer (GVT), which exhibits strong visual comprehension capability at multiple scales. In particular, without introducing extra parameters and task-specific fine-tuning, GVT achieves superior performance on visual question answering, image captioning, and other fine-grained visual understanding tasks such as object counting and multi-class identification.
연구 동기 및 목표
- MLLM 프레임워크 하에서 의미 이해와 세분화된 인식에 대해 시각적 토크나이저를 평가하고 비교하기.
- 특히 마스크 기반 전훈 전략이 지시어 튜닝 과정에서 의미를 유지하는 데에 한계를 보이는 기존 전훈 방법의 한계를 규명하기.
- 강력한 의미 표현과 고해상도 세분화된 시각적 인식을 동시에 구현하는 시각적 토크나이저를 설계하기.
- 학습-테스트 분포 불일치와 종단 간 튜닝 과정에서의 의미 손실을 방지하는 방법 개발하기.
제안 방법
- 의미적(VQA, 캡션 생성) 및 세분화된(객체 수세기, 다중 클래스 식별) 작업 전반에서 시각적 이해를 평가하기 위해 새로운 벤치마크인 GVTBench를 구축하였다.
- 동일한 MLLM 아키텍처에서 DeiT(완전히 지도 학습), CLIP(약한 지도 학습), MAE/DINO/DINOv2(자기지도 학습)를 통해 사전훈련된 시각적 토크나이저를 평가하였다.
- 마스크나 [MASK] 토큰 없이 CLIP 패치 특징에서 특징 정제를 통해 훈련되는 GVT라는 시각적 토크나이저를 제안하여 학습-테스트 불일치를 방지하였다.
- 특징 정제 과정에서 CLIP 특징을 의미적 목표로 사용하여 풍부한 의미를 유지하면서도 영역 수준의 이해 능력을 향상시켰다.
- 추가 파rameter 없이 Vicuna와 함께 종단 간으로 GVT를 훈련시켰으며, 작업별 특화 튜닝을 도입하지 않았다.
- 소규모 지시어 튜닝 데이터셋에서 시각적 토크나이저를 동 冻결 상태로 유지할지 또는 튜닝 가능한지 비교하여 지시어 튜닝 과정에서 의미 유지 능력을 평가하였다.

실험 결과
연구 질문
- RQ1지도 학습, 약한 지도 학습, 자기지도 학습 등의 다양한 전훈 철학이 MLLMs에서 시각적 토크나이저 성능에 어떤 영향을 미치는가?
- RQ2MAE나 MIM과 같은 마스크 기반 전훈 전략이 MLLM 환경에서 시각적 토크나이저에 효과적으로 적용될 수 있는가? 분포 이질성 문제가 발생하지는 않는가?
- RQ3소규모 지시어 튜닝 데이터셋에서 시각적 토크나이저를 함께 튜닝할 경우, 동 冻결된 시각 인식기와 비교해 의미 손실이 발생하는가?
- RQ4강력한 의미 표현과 세분화된 시각적 인식 능력을 동시에 유지할 수 있는 통합된 시각적 토크나이저를 설계할 수 있는가?
주요 결과
- 완전히 지도 학습 및 약한 지도 학습 시각적 토크나이저(예: DeiT, CLIP)는 자기지도 학습 모델(예: DINO, MAE)보다 의미 이해에서 뛰어나지만, 더 큰 전훈 데이터셋을 사용할수록 격차가 줄어든다.
- 자기지도 학습 모델, 특히 패치 수준의 지도 학습을 통한 모델이 객체 수세기 및 다중 클래스 식별과 같은 세분화된 인식 작업에서 뛰어난 성능을 보인다.
- 소규모 지시어 튜닝 데이터셋에서 시각적 토크나이저를 함께 튜닝할 경우 의미 손실이 심각하게 발생하며, 의미 작업에서 동 冻결된 CLIP가 튜닝 가능한 CLIP보다 성능이 뛰어나다.
- 마스크 기반 전훈 전략(예: MAE, MIM)은 학습-테스트 불일치를 유발하며 MLLM 훈련에 부적합하다. 종단 간 최적화가 필요하기 때문에 의미 유지에 악영향을 미친다.
- 마스크 없이 CLIP 패치 특징에서 새로운 모델로 특징 정제를 수행하는 것은 의미를 잘 유지하면서도 영역 수준의 이해 능력을 향상시키는 데 성공하였다.
- 제안된 GVT 토크나이저는 추가 파rameter 없이도 또는 작업별 특화 튜닝 없이도 VQA, 이미지 캡션 생성, 객체 수세기, 다중 클래스 식별에서 최고 성능을 달성한다.
![Figure 2: Framework of our GVT. We first distill the features of a pretrained CLIP via smoothed $\mathcal{L}_{1}$ loss. Then, we use it to encode images into a set of tokens, which are fed into the Perceiver Resampler [ 33 ] as soft prompts. Together with language instructions, these prompts are fed](https://ar5iv.labs.arxiv.org/html/2305.12223/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.