[논문 리뷰] CoBIT: A Contrastive Bi-directional Image-Text Generation Model
CoBIT는 공유된 유니코더-디코더 아키텍처를 사용하여 대조 학습, 이미지-텍스트 생성, 텍스트-이미지 생성을 함께 사전 훈련하는 통합된 비전-언어 기초 모델을 제안한다. 이미지와 텍스트 유니코더가 인코딩 및 디코딩 모드를 전환할 수 있도록 함으로써 CoBIT은 최신의 제로샷 성능을 달성하며, ImageNet에서 82.7%의 상위-1 정확도, 텍스트-이미지 생성에서 FID 9.37, 이미지 캡션에서 CIDEr 44.8을 기록한다.
The field of vision and language has witnessed a proliferation of pre-trained foundation models. Most existing methods are independently pre-trained with contrastive objective like CLIP, image-to-text generative objective like PaLI, or text-to-image generative objective like Parti. However, the three objectives can be pre-trained on the same data, image-text pairs, and intuitively they complement each other as contrasting provides global alignment capacity and generation grants fine-grained understanding. In this work, we present a Contrastive Bi-directional Image-Text generation model (CoBIT), which attempts to unify the three pre-training objectives in one framework. Specifically, CoBIT employs a novel unicoder-decoder structure, consisting of an image unicoder, a text unicoder and a cross-modal decoder. The image/text unicoders can switch between encoding and decoding in different tasks, enabling flexibility and shared knowledge that benefits both image-to-text and text-to-image generations. CoBIT achieves superior performance in image understanding, image-text understanding (Retrieval, Captioning, VQA, SNLI-VE) and text-based content creation, particularly in zero-shot scenarios. For instance, 82.7% in zero-shot ImageNet classification, 9.37 FID score in zero-shot text-to-image generation and 44.8 CIDEr in zero-shot captioning.
연구 동기 및 목표
- 대조 학습, 이미지-텍스트 생성, 텍스트-이미지 생성이라는 세 가지 주요 사전 훈련 목표를 하나의 일관된 프레임워크로 통합하기.
- 동일한 이미지-텍스트 쌍 데이터를 사용하지만 하나 또는 두 개의 목표에만 사전 훈련하는 기존 모델의 한계를 해결하기.
- 이미지 이해, 검색, VQA, 콘텐츠 생성 등 다양한 시각-언어 작업에서 제로샷 및 피니팅된 성능 향상하기.
- 공유된 유니코더 구조를 통해 이원적 인코딩 및 디코딩 간에 파라미터 효율적인 지식 공유 가능하게 하기.
- 세 가지 목표를 하나의 모델에 통합함으로써 상호 보완적인 향상 효과를 얻을 수 있으며, 목표 간 심각한 갈등이 발생하지 않음을 입증하기.
제안 방법
- 공유된 이미지 유니코더와 텍스트 유니코더를 갖춘 새로운 유니코더-디코더 아키텍처를 사용하며, 공유 파라미터를 통해 인코딩 및 디코딩 모드로 전환 가능하다.
- 생성 작업 중에 양방향 특징을 융합하기 위해 크로스 어텐션 디코더를 사용한다.
- 대조 사전 훈련 동안 두 유니코더는 모두 인코더로 기능하여 대조 손실을 통해 이미지 및 텍스트 표현을 정렬한다.
- 이미지-텍스트 생성 동안 이미지 유니코더는 이미지를 인코딩하고, 텍스트 유니코더는 자동회귀적으로 캡션을 디코딩하며, 크로스 어텐션은 인코딩된 이미지에 주목한다.
- 텍스트-이미지 생성 동안 텍스트 유니코더는 프롬프트를 인코딩하고, 이미지 유니코더는 자동회귀적으로 이미지 토큰을 디코딩하며, 크로스 어텐션은 인코딩된 텍스트에 주목한다.
- 대규모 노이즈가 있는 웹 크롤링된 이미지-텍스트 데이터 및 이미지 애너테이션 데이터를 사용하여 사전 훈련하며, 대조, I2T, T2I 손실을 공동 최적화한다.
실험 결과
연구 질문
- RQ1공유 파라미터를 사용하여 하나의 모델이 대조 학습, 이미지-텍스트 생성, 텍스트-이미지 생성을 효과적으로 통합할 수 있는가?
- RQ2세 가지 목표를 함께 사전 훈련함으로써 제로샷 및 피니팅된 시각-언어 작업 전반의 성능에 어떤 영향을 미치는가?
- RQ3이미지-텍스트 및 텍스트-이미지 생성 목표 간에 갈등이 어느 정도 발생하며, 통합 프레임워크 내에서 이를 조율할 수 있는가?
- RQ4인코딩 및 디코딩 간에 파라미터를 공유하는 제안된 유니코더 메커니즘이 별도의 인코더 대비 성능 향상과 파라미터 효율성을 높이는가?
- RQ5CoBIT은 피니팅 없이도 강력한 제로샷 능력을 갖출 수 있는가, 특히 이미지 분류, 캡션 생성, 텍스트-이미지 생성에서 성능이 우수한가?
주요 결과
- CoBIT은 ImageNet 분류에서 82.7%의 제로샷 상위-1 정확도를 달성하여 강력한 시각적 표현 학습 능력을 입증한다.
- 제로샷 텍스트-이미지 생성에서 CoBIT은 FID 점수 9.37을 기록하여 프롬프트에서 고품질이고 다양한 이미지를 생성함을 시사한다.
- 제로샷 이미지 캡션 생성에서 CoBIT은 CIDEr 점수 44.8을 달성하여 생성된 캡션과 기준 기술 간의 강한 일치를 보여준다.
- 피니팅 후 CoBIT은 ImageNet에서 선형 프로빙 정확도 86.44%, 텍스트-이미지 생성에서 FID 4.62, VQA 점수 78.3을 기록하여 뛰어난 전이 능력을 보인다.
- 절단 실험 결과, T2I와 I2T 목표 간 약간의 갈등이 존재함을 확인할 수 있었으며(예: T2I 손실 추가 시 VQA 점수 2.6pt 하락), 그러나 전체 프레임워크는 안정적이고 효과적이다.
- 사전 초기화 없이 CoBIT을 처음부터 훈련시키는 경우, 제로샷 ImageNet 정확도는 0.3% 감소하고 FID는 0.2 증가에 그쳐 모델의 초기 훈련 가능성과 안정성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.