[논문 리뷰] ZeroCap: Zero-Shot Image-to-Text Generation for Visual-Semantic Arithmetic
ZeroCap는 CLIP의 시각-의미 벡터 표현과 사전 훈련된 언어 모델(GPT-2)을 결합하여, 어떤 미세조정 없이도 다양하고 의미적으로 기반된 캡션을 생성하는 제로샷 이미지-텍스트 생성 방법을 제안한다. CLIP의 의미 정렬 능력과 GPT-2의 생성 능력을 활용함으로써, 이미지 기반의 유사성 및 비교와 같은 새로운 시각-의미 연산이 가능해지며, 시각적 관계 벤치마크에서 최신 기준 성능을 달성하면서도 높은 의미적 정확도를 유지한다.
Recent text-to-image matching models apply contrastive learning to large corpora of uncurated pairs of images and sentences. While such models can provide a powerful score for matching and subsequent zero-shot tasks, they are not capable of generating caption given an image. In this work, we repurpose such models to generate a descriptive text given an image at inference time, without any further training or tuning steps. This is done by combining the visual-semantic model with a large language model, benefiting from the knowledge in both web-scale models. The resulting captions are much less restrictive than those obtained by supervised captioning methods. Moreover, as a zero-shot learning method, it is extremely flexible and we demonstrate its ability to perform image arithmetic in which the inputs can be either images or text, and the output is a sentence. This enables novel high-level vision capabilities such as comparing two images or solving visual analogy tests. Our code is available at: https://github.com/YoadTew/zero-shot-image-to-text.
연구 동기 및 목표
- 모든 미세조정이나 모델 재학습 없이 제로샷 이미지 캡션 생성을 가능하게 하기 위해.
- 감독 학습 기반 캡션 모델이 제약된 스크립트 형식의 캡션을 생성하는 한계를 극복하기 위해 웹 스케일의 사전 훈련된 모델을 활용하기 위해.
- 시각-의미 연산을 가능하게 하여, 이미지 기반의 유사성 및 비교와 같은 작업을 수행하기 위해.
- 사람이 애너테이션한 데이터셋을 초월하여 현실 세계 지식과 의미적 다양성을 반영한 캡션을 생성하기 위해.
- CLIP와 언어 모델을 조합함으로써 고수준의 시각 능력, 예를 들어 이미지 유사성 문제 해결이 가능하다는 것을 입증하기 위해.
제안 방법
- 이 방법은 추론 시점에 CLIP의 시각 및 텍스트 인코더와 GPT-2의 자동회귀적 언어 생성 기능을 결합하여 이미지 캡션을 생성한다.
- 디코딩 중에 GPT-2의 어텐션 메커니즘의 키-밸류 쌍을 모든 레이어와 헤드에서 수정하여 생성된 토큰이 CLIP의 시각-의미 임베딩 공간과 정렬되도록 한다.
- 캡션 생성 과정은 완전히 제로샷이며, CLIP와 GPT-2의 사전 훈련된 가중치 외에 파라미터 업데이트 없이 작동한다.
- 이 방법은 이미지와 텍스트를 공통된 CLIP 임베딩 공간 내의 벡터로 간주함으로써 다중 모odal 연산을 가능하게 하여, 'A는 B와 같고, C는 X와 같다'와 같은 연산을 허용한다.
- 생성된 캡션과 입력 이미지 간의 의미 정렬 수준을 평가하기 위해 CLIP-score를 핵심 평가 지표로 사용한다.
- 이 방법은 이미지-텍스트 및 텍스트-이미지 연산을 모두 지원하며, 예를 들어 '낮'과 '밤'과 같은 텍스트 프롬프트를 사용해 낮 이미지를 밤 이미지로 변환하는 데에도 활용할 수 있다.

실험 결과
연구 질문
- RQ1이중 훈련된 데이터셋에 대한 어떤 미세조정 없이도 다양하고 의미적으로 풍부한 캡션을 생성할 수 있는가?
- RQ2사전 훈련된 모델만을 사용하여 시각-의미 연산을 수행할 수 있으며, 이미지 유사성 문제 해결과 같은 작업을 수행할 수 있는가?
- RQ3이 방법의 캡션 품질은 의미 정렬과 다양성 측면에서 감독 기반 베이스라인과 비교해 어떻게 되는가?
- RQ4모델이 커리티드 데이터셋을 초월하여 현실 세계 지식을 반영한 캡션을 얼마나 잘 생성할 수 있는가?
- RQ5공통된 임베딩 공간 내에서 이미지와 텍스트를 조합함으로써 다중 모달 추론을 수행할 수 있는가?
주요 결과
- ZeroCap는 시각적 관계 벤치마크에서 CLIP-score 0.70을 기록하여, 기준 모델인 ClipCap(0.24)보다 뚜렷이 높은 의미 정렬 수준을 확보했다.
- 동일한 벤치마크에서 BLEU-1 점수 0.10과 Recall@5 0.32를 기록하여, ClipCap의 0.003과 0.035보다 훨씬 뛰어난 캡션 품질을 입증했다.
- 생성된 캡션은 감독 기반 모델의 캡션보다 더 다양하고 스크립트 형식이 적으며, 더 넓은 현실 세계 지식과 의미적 풍부함을 반영하고 있다.
- 모델은 시각-의미 연산을 성공적으로 수행하였으며, '낮'과 '밤'과 같은 텍스트 프롬프트를 사용해 '아침 식사' 이미지에서 '저녁 식사' 캡션을 생성하는 데 성공했다.
- 이 방법은 이미지 간 의미적 비교 및 시각적 유사성 문제 해결과 같은 새로운 고수준 시각 작업을 가능하게 하였으며, 공식 X ∼ C + B - A를 사용한다.
- GPT-3가 아닌 GPT-2를 사용하고도 이 방법은 강력한 제로샷 능력을 보였으며, 대규모 사전 훈련된 모델을 조합함으로써 그 힘을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.