[论文解读] DatasetGAN: Efficient Labeled Data Factory with Minimal Human Effort
DatasetGAN 通过利用预训练的 StyleGAN 合成图像,并使用轻量级解码器从极少的人工标注样本中预测像素级标签,生成高质量、细节丰富的语义分割数据集。该方法生成的合成数据集可实现语义分割和关键点检测的最先进性能,仅需真实数据集 1/100 的标注数据即可达到全监督模型的性能水平。
We introduce DatasetGAN: an automatic procedure to generate massive datasets of high-quality semantically segmented images requiring minimal human effort. Current deep networks are extremely data-hungry, benefiting from training on large-scale datasets, which are time consuming to annotate. Our method relies on the power of recent GANs to generate realistic images. We show how the GAN latent code can be decoded to produce a semantic segmentation of the image. Training the decoder only needs a few labeled examples to generalize to the rest of the latent space, resulting in an infinite annotated dataset generator! These generated datasets can then be used for training any computer vision architecture just as real datasets are. As only a few images need to be manually segmented, it becomes possible to annotate images in extreme detail and generate datasets with rich object and part segmentations. To showcase the power of our approach, we generated datasets for 7 image segmentation tasks which include pixel-level labels for 34 human face parts, and 32 car parts. Our approach outperforms all semi-supervised baselines significantly and is on par with fully supervised methods, which in some cases require as much as 100x more annotated data as our method.
研究动机与目标
- 解决为语义分割构建大规模、精细标注图像数据集所面临的高昂成本和高强度的人工劳动问题。
- 通过利用生成模型合成图像及其对应的语义标签,减少对大量人工标注的依赖。
- 实现基于合成数据集训练深度学习模型,其性能可与在真实数据上全监督训练的模型相媲美或超越。
- 通过提供丰富的部件级和关键点标注,支持 3D 重建和可动画化物体建模等复杂下游应用。
- 证明仅需 16–30 个人工标注样本即可训练出在多种分割任务中具有良好泛化能力的模型。
提出的方法
- 利用预训练的 StyleGAN 在潜在空间中生成多样化且逼真的图像。
- 仅对少量合成图像(例如 16–30 幅)进行人工密集像素级分割标注。
- 训练一个轻量级、浅层解码器网络,将 GAN 的潜在码映射为语义分割掩码,实现在整个潜在空间上的泛化。
- 使用训练好的解码器自动生成无限流式合成的、完全标注的图像-分割对。
- 在合成数据集上训练任意下游计算机视觉模型,并在真实测试数据上进行评估。
- 通过集成可微渲染和 2D 监督,将框架扩展至预测 3D 部件分割和 3D 关键点。
实验结果
研究问题
- RQ1能否仅使用少量从 GAN 生成分布中采样的人工标注图像,训练出一个能泛化至整个潜在空间的解码器,从而实现高质量的语义分割?
- RQ2通过该方法生成的合成数据集在多大程度上能与在真实数据上全监督训练的模型性能相匹配或超越?
- RQ3该方法能否以极低的人工投入生成丰富且细粒度的标注(例如 34 个人脸部件、32 个汽车部件)?
- RQ4该方法在关键点检测和单目图像 3D 重建等下游任务中的有效性如何?
- RQ5该方法能否支持复杂 3D 应用,如通过部件级和关键点监督实现可动画化的 3D 资产生成?
主要发现
- DatasetGAN 在 7 项分割任务(包括人脸和汽车部件分割)中显著优于所有半监督学习基线方法。
- 在某些情况下,即使仅使用真实数据 1/100 的标注数据,该方法的性能仍可与全监督模型持平。
- 在 CUB 鸟类数据集上,使用 30 个人工标注样本训练的合成数据模型,其性能优于使用相同标注预算微调的基线模型。
- 在汽车关键点检测任务中,仅用 16 个标注样本训练的合成数据模型,在 20 张真实测试图像上也取得了优异性能。
- 该方法首次实现了从单张图像进行可动画化的 3D 汽车重建,具备可动车轮、正确材质和动态光照效果,且仅使用了 30 个人工标注样本。
- 该框架成功生成了高质量、细节丰富的部件级和关键点标注,支持实现具备物理模拟和动画功能的真实感 3D 资产创建。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。