[논문 리뷰] Instruction-ViT: Multi-Modal Prompts for Instruction Learning in ViT
이 논문은 지시 훈련을 통해 다중모달 프롬프트(텍스트, 이미지 또는 조합)를 활용하는 이미지 분류 성능을 향상시키는 Instruction-ViT라는 비전 트랜스포머 프레임워크를 제안한다. ViT 기반 구조와 함께 시각적 및 텍스트 프롬프트 임베딩을 동시에 미세조정함으로써, 다양한 데이터셋에서 뛰어난 정확도와 더 빠른 적응성을 확보하며, 표준 미세조정 및 시각적 프롬프트 훈련(VPT) 방법을 능가한다.
Prompts have been proven to play a crucial role in large language models, and in recent years, vision models have also been using prompts to improve scalability for multiple downstream tasks. In this paper, we focus on adapting prompt design based on instruction tuning into a visual transformer model for image classification which we called Instruction-ViT. The key idea is to implement multi-modal prompts (text or image prompt) related to category information to guide the fine-tuning of the model. Based on the experiments of several image captionining tasks, the performance and domain adaptability were improved. Our work provided an innovative strategy to fuse multi-modal prompts with better performance and faster adaptability for visual classification models.
연구 동기 및 목표
- 지시 훈련을 다중모달 프롬프트와 융합하여 비전 트랜스포머의 이미지 분류 성능 향상
- 텍스트, 이미지 또는 조합 프롬프트가 제로샷 또는 피처샷 환경에서 모델의 적응성과 정확도에 미치는 영향 탐구
- 사전 훈련된 ViT 기반 구조를 활용한 프롬프트 훈련을 통해 광범위한 파라미터 업데이트 필요성 감소
- 다양한 이미지 분류 벤치마크에서 다중모달 프롬프트의 효과성 평가
- 시각 작업을 위한 지시 신호로 텍스트 및 시각적 프롬프트를 동시에 사용할 수 있는지 탐색
제안 방법
- 사전 훈련된 ViT-B 기반 구조를 사용하며, 시각적 및 텍스트적 특징 추출을 위해 CLIP-엔코더 활용
- 가능한 이미지 카테고리 기반으로 텍스트 프롬프트를 구성하고, 이미지 토큰과 동일한 임베딩 공간으로 투영
- 분류 헤드와 함께 이미지 및 텍스트 프롬프트 임베딩을 함께 미세조정하여 입력 이미지 표현과 일치시키기
- CLS 토큰과 각 카테고리의 프롬프트 임베딩 간 유사도 점수를 계산하여 분류 수행
- 유일모달(텍스트 또는 이미지) 및 다중모달(텍스트 + 이미지) 프롬프트를 모두 지원하여 탄력적인 미세조정 가능
- 사전 훈련된 ViT 파라미터의 대부분을 유지하면서 프롬프트 임베딩과 분류 헤드만 미세조정
실험 결과
연구 질문
- RQ1지시 훈련을 통한 다중모달 프롬프트가 비전 트랜스포머의 제로샷 및 피처샷 이미지 분류 성능 향상에 기여하는가?
- RQ2텍스트 전용, 이미지 전용, 또는 텍스트-이미지 조합 프롬프트 사용이 모델 정확도와 적응성에 미치는 영향은 어떠한가?
- RQ3사전 훈련된 ViT와 CLIP 엔코더를 활용한 프롬프트 기반 훈련이 표준 미세조정 및 시각적 프롬프트 훈련(VPT)을 능가하는가?
- RQ4특정 프롬프트 모odal(텍스트, 이미지, 혼합)이 어떤 데이터셋이나 환경에서 최적의 성능을 내는가?
- RQ5다중모달 프롬프트는 광범위한 파라미터 업데이트 없이도 성능을 유지하거나 향상시킬 수 있는가?
주요 결과
- Instruction-ViT는 네 개의 데이터셋 평균 정확도 95.59%를 기록하여 표준 ViT-B(95.57%) 및 DeiT-B, ResNet-152와 같은 다른 모델들을 능가했다.
- Oxford-III Pets 데이터셋에서 텍스트 프롬프트는 84.74%의 정확도를 기록하여 모든 프롬프트 유형 중 최고 성능을 보였다.
- Caltech-101에서 이미지 프롬프트는 80.85%의 정확도를 기록하여 이 데이터셋에서 모든 프롬프트 유형 중 최고 성능을 기록했다.
- Stanford Cars에서 혼합 텍스트-이미지 프롬프트는 66.11%의 정확도를 기록하여 이 데이터셋에서 모든 프롬프트 유형 중 최고 성능을 기록했다.
- Instruction-ViT는 VPT 방법보다 평균 7.9% 높은 성능을 보이며 지시 유도 다중모달 프롬프팅의 우수성을 입증했다.
- 모델는 특히 각 데이터셋에 맞는 모odal 특화 프롬프트를 사용할 경우 더 빠른 적응성과 우수한 도메인 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.