[论文解读] SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
SynthCLIP 提出了一种完全基于合成数据的 CLIP 模型训练框架,利用大语言模型(LLMs)和文本到图像(TTI)扩散模型,无需真实数据即可生成可扩展、高质量且安全的图像-文本配对数据。其性能与基于真实数据训练的 CLIP 模型相当,证明了完全合成数据可实现视觉-语言模型的可扩展、可控且安全的预训练。
We present SynthCLIP, a CLIP model trained on entirely synthetic text-image pairs. Leveraging recent text-to-image (TTI) networks and large language models (LLM), we generate synthetic datasets of images and corresponding captions at scale, with no human intervention. In this work, we provide an analysis on CLIP models trained on synthetic data. We provide insights on the data generation strategy, number of samples required, scaling trends, and resulting properties. We also introduce SynthCI-30M, a purely synthetic dataset comprising 30 million captioned images. Our code, trained models, and data, are released as open source at https://github.com/hammoudhasan/SynthCLIP
研究动机与目标
- 解决网络获取的图文数据集存在的局限性,包括数据噪声、长尾分布和安全风险。
- 探究 CLIP 模型是否可以完全基于合成数据进行训练,而无需依赖任何真实数据。
- 开发一种可扩展的自动化流水线,以大规模生成多样化、均衡且安全的合成图文对。
- 评估概念分布和语言模型选择对合成训练的 CLIP 模型下游性能的影响。
- 发布大规模合成数据集(SynthCI-30M)和训练代码,以支持可复现性及合成数据训练的进一步研究。
提出的方法
- 利用包含 500,000 个概念的概念库,确保视觉和语言元素的多样性与覆盖度。
- 使用大语言模型(如 Mistral 7B)通过指令遵循提示,从采样概念生成描述性文本 caption。
- 使用文本到图像扩散模型(如 Stable Diffusion v1.5)基于 LLM 生成的 caption 生成图像。
- 通过端到端生成配对,确保文本与图像之间的一致性,保障语义一致性。
- 通过先进 LLM 和 TTI 模型内置的安全防护机制实施安全过滤,避免生成有害内容。
- 使用对比学习在完全合成的数据集上训练 CLIP 模型,以学习联合的视觉-语言表征。

实验结果
研究问题
- RQ1仅使用完全合成的图文对训练的 CLIP 模型能否达到与基于真实世界数据集训练的模型相当的性能?
- RQ2训练数据中概念的分布如何影响合成训练的 CLIP 模型的下游性能?
- RQ3使用不同大语言模型进行文本生成对合成数据质量和模型性能有何影响?
- RQ4与均衡采样或特定概念采样相比,随机采样概念是否会导致性能下降?
- RQ5合成数据生成流水线能否在无需人工干预的情况下实现可扩展性和安全性,同时保持模型泛化能力?
主要发现
- 在 3000 万组合成图像-文本对上训练的 SynthCLIP,其性能与在真实数据集上预训练的 CLIP 模型相当,仅在下游任务中存在微小性能差距。
- 从概念库中采用均衡采样策略,相比随机采样,图像检索和文本检索性能分别提升 2.7%,凸显了类别分布的重要性。
- 使用 Mistral 7B 模型进行文本生成优于 33B 的 Vicuna 模型,可能是因为 Mistral 7B 在文本生成任务上具有更强的指令遵循能力。
- 基于 CC3M 衍生的概念子集(40k 子集)进行训练,相比使用完整概念库,文本检索性能提升 3.9%,线性探测性能提升 1.6%,表明 CC3M 中存在有利于下游任务的概念分布偏差。
- 随机选择的概念子集性能劣于完整概念库,表明概念的相关性和覆盖度对模型泛化能力具有显著影响。
- 发布 SynthCI-30M,一个包含 3000 万组配对图像与文本的完全合成数据集,实现了无需真实数据的大规模、安全且可扩展的预训练。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。