Skip to main content
QUICK REVIEW

[논문 리뷰] SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?

Hasan Abed Al Kader Hammoud, Hani Itani|arXiv (Cornell University)|2024. 02. 02.
Myasthenia Gravis and ThymomaMedicine인용 수 3
한 줄 요약

SynthCLIP는 대규모 언어모델(Large Language Models, LLMs)과 텍스트-이미지 복소 모델(Text-to-Image, TTI)을 활용하여 실제 데이터 없이도 확장성 있고 고품질이며 안전한 이미지-캡션 쌍을 생성하는 완전히 합성된 훈련 프레임워크를 제안한다. 이는 실제 데이터로 훈련된 CLIP 모델과 동등한 성능을 달성하며, 합성 데이터만으로도 확장성 있고 제어 가능하며 안전한 시각-언어 모델의 사전 훈련이 가능하다는 것을 입증한다.

ABSTRACT

We present SynthCLIP, a CLIP model trained on entirely synthetic text-image pairs. Leveraging recent text-to-image (TTI) networks and large language models (LLM), we generate synthetic datasets of images and corresponding captions at scale, with no human intervention. In this work, we provide an analysis on CLIP models trained on synthetic data. We provide insights on the data generation strategy, number of samples required, scaling trends, and resulting properties. We also introduce SynthCI-30M, a purely synthetic dataset comprising 30 million captioned images. Our code, trained models, and data, are released as open source at https://github.com/hammoudhasan/SynthCLIP

연구 동기 및 목표

  • 웹 기반 텍스트-이미지 데이터셋의 한계, 즉 데이터 노이즈, 긴 꼬리 분포, 안전성 위험을 해결하기 위해.
  • 실제 데이터를 전혀 사용하지 않고도 CLIP 모델을 완전히 합성 데이터로 훈련시킬 수 있는지 탐구하기 위해.
  • 대규모로 다양하고 균형 잡히며 안전한 합성 텍스트-이미지 쌍을 자동으로 생성할 수 있는 확장 가능한 파이프라인 개발을 위해.
  • 학습 데이터의 개념 분포와 언어모델 선택이 합성 훈련된 CLIP 모델의 최종 성능에 미치는 영향을 평가하기 위해.
  • 재현 가능성과 합성 데이터 훈련 분야의 향후 연구를 가능하게 하기 위해 대규모 합성 데이터셋(SynthCI-30M)과 훈련 코드를 공개하기 위해.

제안 방법

  • 50만 개의 개념을 포함하는 대규모 개념 뱅크를 활용하여 시각적 요소와 언어적 요소의 다양성과 포괄성을 확보한다.
  • 샘플링된 개념들로부터 지시 수행 프롬프팅을 통해 대규모 언어모델(Large Language Model, 예: Mistral 7B)을 활용해 기술적 캡션을 생성한다.
  • LLM이 생성한 캡션을 조건으로 하여 텍스트-이미지 복소 모델(Text-to-Image Diffusion Model, 예: Stable Diffusion v1.5)를 사용해 이미지를 생성한다.
  • 텍스트와 이미지 간의 일치를 보장하기 위해 종단 간(end-to-end)으로 쌍을 생성함으로써 의미적 일致성을 확보한다.
  • 최신 LLM과 TTI 모델 내장 보호 기능을 통해 안전 필터링을 수행하여 유해 콘텐츠를 방지한다.
  • 대조 학습(contrastive learning)을 사용해 완전히 합성된 데이터셋으로 CLIP 모델을 훈련시어 공동의 시각-언어 표현을 학습한다.
Figure 1 : Advantages of SynthCLIP. Collecting text-image pairs from the internet often presents challenges: captions may not accurately match the images, specific classes may have limited representation due to scarcity, and there is a risk of encountering harmful content. We propose SynthCLIP, an a
Figure 1 : Advantages of SynthCLIP. Collecting text-image pairs from the internet often presents challenges: captions may not accurately match the images, specific classes may have limited representation due to scarcity, and there is a risk of encountering harmful content. We propose SynthCLIP, an a

실험 결과

연구 질문

  • RQ1완전히 합성된 텍스트-이미지 쌍으로만 훈련된 CLIP 모델이 실제 세계 데이터셋으로 훈련된 모델과 동등한 성능을 달성할 수 있는가?
  • RQ2학습 데이터의 개념 분포가 합성 훈련된 CLIP 모델의 최종 성능에 어떤 영향을 미치는가?
  • RQ3캡션 생성에 다른 대규모 언어모델을 사용할 경우 합성 데이터의 품질과 모델 성능에 어떤 영향을 미치는가?
  • RQ4무작위 개념 샘플링이 균형 잡힌 또는 개념 중심 샘플링에 비해 성능 저하를 초래하는가?
  • RQ5인간의 간섭 없이도 합성 데이터 생성 파이프라인은 확장성과 안전성을 확보하면서 모델 일반화 능력을 유지할 수 있는가?

주요 결과

  • 3000만 개의 합성 이미지-캡션 쌍으로 훈련된 SynthCLIP는 실제 데이터로 사전 훈련된 CLIP 모델과 비교할 만한 성능을 보이며, 최종 작업에서 미미한 성능 격차 외에는 유사한 성능을 달성한다.
  • 개념 뱅크에서 개념을 균형 있게 샘플링할 경우, 무작위 샘플링 대비 이미지 검색 및 텍스트 검색 성능이 각각 2.7% 향상되어 클래스 분포의 중요성을 입증한다.
  • 캡션 생성에 Mistral 7B 모델을 사용할 경우 33B Vicuna 모델보다 성능이 뛰어나며, 이는 캡션 작업에서 지시 수행 능력이 뛰어나기 때문일 것이다.
  • CC3M에서 유도된 개념(4만 개 서브셋)으로 훈련할 경우, 전체 개념 뱅크 대비 텍스트 검색 성능이 3.9% 향상되고 선형 프로빙 성능이 1.6% 향상되어 CC3M의 개념 분포가 최종 작업에 유리한 요소를 포함하고 있음을 시사한다.
  • 무작위로 선택된 개념 서브셋은 전체 개념 뱅크에 비해 성능이 열 劣하므로, 개념의 관련성과 커버리지가 모델 일반화에 크게 영향을 미친다는 것을 시사한다.
  • 3000만 개의 이미지-캡션 쌍을 포함하는 완전히 합성된 데이터셋인 SynthCI-30M의 공개는 실제 데이터 없이 대규모, 안전하고 확장 가능한 사전 훈련을 가능하게 한다.
Figure 2 : Pipeline Overview. From a set of concepts $\mathcal{C}$ (left), we obtain a set of synthetic captions $\mathcal{T}$ with an LLM, further refined to $\mathcal{T}^{*}$ by a filtering operation which subsamples $\mathcal{T}$ using balanced sampling (top). The generated captions are then used
Figure 2 : Pipeline Overview. From a set of concepts $\mathcal{C}$ (left), we obtain a set of synthetic captions $\mathcal{T}$ with an LLM, further refined to $\mathcal{T}^{*}$ by a filtering operation which subsamples $\mathcal{T}$ using balanced sampling (top). The generated captions are then used

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.