Skip to main content
QUICK REVIEW

[论文解读] PUG: Photorealistic and Semantically Controllable Synthetic Data for Representation Learning

Florian Bordes, Shashank Shekhar|arXiv (Cornell University)|Aug 8, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文介绍了PUG(Photorealistic Unreal Graphics),一种利用虚幻引擎生成的新型合成数据集家族,旨在为表示学习提供逼真且语义可控的数据。通过结合高保真度的真实感与对姿态、纹理和光照等场景因素的精确控制,PUG能够对视觉模型的鲁棒性和泛化能力进行严格评估,在零样本迁移和故障模式分析方面显著优于现有基准。

ABSTRACT

Synthetic image datasets offer unmatched advantages for designing and evaluating deep neural networks: they make it possible to (i) render as many data samples as needed, (ii) precisely control each scene and yield granular ground truth labels (and captions), (iii) precisely control distribution shifts between training and testing to isolate variables of interest for sound experimentation. Despite such promise, the use of synthetic image data is still limited -- and often played down -- mainly due to their lack of realism. Most works therefore rely on datasets of real images, which have often been scraped from public images on the internet, and may have issues with regards to privacy, bias, and copyright, while offering little control over how objects precisely appear. In this work, we present a path to democratize the use of photorealistic synthetic data: we develop a new generation of interactive environments for representation learning research, that offer both controllability and realism. We use the Unreal Engine, a powerful game engine well known in the entertainment industry, to produce PUG (Photorealistic Unreal Graphics) environments and datasets for representation learning. In this paper, we demonstrate the potential of PUG to enable more rigorous evaluations of vision models.

研究动机与目标

  • 为解决现有合成数据集缺乏真实感和细粒度控制的问题,创建新一代逼真且可控的合成数据,用于表示学习。
  • 实现对视觉模型在姿态、纹理、光照和背景等可控分布偏移下鲁棒性的系统性评估。
  • 提供一种可扩展、可访问且逼真的真实世界数据替代方案,以应对隐私、偏见和版权等问题。
  • 展示合成数据在克服视觉-语言基准已知局限性(如对背景敏感、泛化能力差)方面的实用性。

提出的方法

  • 利用虚幻引擎——一种以逼真度著称的高保真游戏引擎——生成具有精确场景因素控制能力的PUG环境与数据集。
  • 设计四个独立数据集:PUG: Animals用于分布外泛化,PUG: ImageNet用于鲁棒性评估,PUG: SPAR用于视觉-语言模型探测,PUG: AR4T用于微调。
  • 开发TorchMultiverse Python库,实现对场景属性进行细粒度控制的交互式、程序化数据集创建。
  • 使用预训练CLIP模型,并在PUG数据集上进行微调,以评估在各种因素变化下的零样本与微调性能。
  • 引入单一环境设置(盐碱平原)以隔离并分析因背景变化导致的模型失败,独立于背景变化本身。
  • 应用因子标注技术,以探测表示学习动态,例如模型在训练过程中关注哪些因素。

实验结果

研究问题

  • RQ1与真实世界基准相比,逼真合成数据在多大程度上能提升视觉模型的鲁棒性与泛化能力?
  • RQ2视觉-语言模型在对象纹理、位置和背景的可控变化下表现如何?会涌现出哪些故障模式?
  • RQ3合成数据能否用于系统性评估并提升模型对特定因素(如姿态、光照、物体尺寸)不变性的能力?
  • RQ4在PUG: AR4T上微调合成数据后,与真实世界基准相比,模型在下游视觉-语言任务上的性能是否得到提升?
  • RQ5通过使用具有精确因子控制的数据集,可以对模型注意力机制和表示学习动态获得哪些新见解?

主要发现

  • PUG: SPAR显示,视觉-语言模型对背景变化极为敏感,检索准确率从单一背景(盐碱平原)下的94%下降至多背景场景下的78%。
  • 即使大型视觉-语言模型如ViT-G-14(OpenCLIP)在简单PUG: SPAR样本上也出现失败,零样本准确率在纹理变化下降至48.44%,在位置推理任务中低于30%。
  • 在PUG: AR4T上对CLIP模型进行10轮(20万数据集)和2轮(100万数据集)微调,显著提升了性能,证明了合成数据在微调中的可靠性与实用性。
  • PUG: ImageNet数据集使模型在100多个因素(包括姿态、光照和纹理)下的鲁棒性得以系统评估,揭示了在分布偏移下性能显著下降。
  • PUG: Animals数据集有效实现了对基础模型表征的探测,表明当在受控且逼真的数据上训练时,模型能够学习到解耦的表征。
  • TorchMultiverse库实现了高效、程序化地生成多样化且因子可控的数据,证明其在可扩展、可复现的表示学习实验中至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。