[论文解读] Interactive Data Synthesis for Systematic Vision Adaptation via LLMs-AIGCs Collaboration
本文提出 ChatGenImage,一种新颖的交互式数据合成框架,通过大型语言模型(LLMs)与AIGC模型(如Stable Diffusion)之间的协作提示,生成高质量、多样化且精细标注的合成图像,以实现系统的视觉适应。通过迭代地利用LLM引导的全局与局部提示优化图像生成,该方法实现了可控、低成本的数据增强,尤其适用于罕见或未见领域,显著提升了下游模型的泛化能力,且仅需极少的人工干预。
Recent text-to-image generation models have shown promising results in generating high-fidelity photo-realistic images. In parallel, the problem of data scarcity has brought a growing interest in employing AIGC technology for high-quality data expansion. However, this paradigm requires well-designed prompt engineering that cost-less data expansion and labeling remain under-explored. Inspired by LLM's powerful capability in task guidance, we propose a new paradigm of annotated data expansion named as ChatGenImage. The core idea behind it is to leverage the complementary strengths of diverse models to establish a highly effective and user-friendly pipeline for interactive data augmentation. In this work, we extensively study how LLMs communicate with AIGC model to achieve more controllable image generation and make the first attempt to collaborate them for automatic data augmentation for a variety of downstream tasks. Finally, we present fascinating results obtained from our ChatGenImage framework and demonstrate the powerful potential of our synthetic data for systematic vision adaptation. Our codes are available at https://github.com/Yuqifan1117/Labal-Anything-Pipeline.
研究动机与目标
- 通过使用合成数据实现可扩展、低成本的数据增强,解决视觉任务中的数据稀缺与领域偏移问题。
- 克服现有基于AIGC的数据合成方法的局限性,这些方法通常生成简单、以物体为中心的图像,缺乏场景复杂性和领域多样性。
- 利用LLM的零样本推理与指令遵循能力,引导AIGC模型生成复杂、语义丰富的场景,并附带细粒度标注。
- 开发一种交互式、迭代式的流程,结合LLM进行提示工程与AIGC进行图像生成,实现对下游视觉任务的可控且可扩展的数据扩展。
提出的方法
- 使用 gpt-3.5-turbo 作为LLM,基于输入标签采用零样本提示策略生成全局与局部提示,以引导图像生成。
- 使用 Stable Diffusion v1.5 作为AIGC骨干网络,从LLM生成的提示中生成 512×512 分辨率的图像,推理时温度设为 0 以确保稳定性。
- 实施一个迭代优化循环,LLM分析生成的图像,识别缺失或错误的元素,并发出针对性的局部编辑提示,以提升真实感与语义准确性。
- 集成一个标签基础工具包,自动检测并验证生成图像中物体的存在性与空间关系,确保语义一致性。
- 应用开放词汇物体检测技术,筛选出未能保留原始物体语义或背景上下文的图像,仅保留高质量、语义对齐的输出。
- 通过文本约束与图像内容之间的语义对齐分数对图像候选进行排序,剔除低置信度结果,以确保数据质量。
实验结果
研究问题
- RQ1LLM能否通过迭代提示有效引导AIGC模型生成复杂、多样化且语义准确的图像,即使对于罕见或不熟悉的概念?
- RQ2LLM与AIGC模型之间的协作如何相比朴素提示驱动的AIGC生成方式,提升合成数据的可控性与质量?
- RQ3通过此交互式流程生成的合成数据在多大程度上能增强下游视觉模型在未见领域中的泛化能力与鲁棒性?
- RQ4该框架能否系统性地生成细粒度标注与多样化场景构图(如夜间、雪地、森林)?这些通常在标准数据增强中被忽略。
- RQ5迭代优化过程在纠正幻觉、提升物体一致性与空间关系方面有多有效?
主要发现
- ChatGenImage 成功生成了针对罕见与濒危物种的高保真、复杂场景图像,并附带细粒度标注,即使这些概念对标准分类器不熟悉。
- LLM与AIGC的迭代协作显著提升了图像质量与语义准确性,实现了多样化场景(如山脉、森林、夜间)的生成,这些在标准数据增强中常被忽视。
- 该框架实现了文本提示与生成图像之间高度的语义对齐,通过物体检测与语义评分进行过滤,确保仅保留高质量输出。
- 该方法通过最小化人工干预,实现了低成本、可扩展的数据增强,整个流程仅在单张消费级GPU(Nvidia RTX 3090)上运行。
- 定性结果表明,LLM能有效引导AIGC模型整合特定物体关系与空间布局,如山地场景中的雪地树木与溪流。
- 该框架在系统性视觉适应方面展现出强大潜力,通过生成覆盖未见领域与长尾类别的合成数据,增强了模型在真实部署中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。