[论文解读] Procedural Image Programs for Representation Learning
本文提出一个包含21,000个使用OpenGL片段着色语言编写的程序化图像生成着色器的大规模数据集,以实现在无需真实图像的情况下实现高性能表征学习。通过在这些多样化、快速渲染的程序上训练神经网络,该方法在监督和自监督表征学习中均达到最先进性能,将与真实图像预训练的准确率差距缩小了38%。
Learning image representations using synthetic data allows training neural networks without some of the concerns associated with real images, such as privacy and bias. Existing work focuses on a handful of curated generative processes which require expert knowledge to design, making it hard to scale up. To overcome this, we propose training with a large dataset of twenty-one thousand programs, each one generating a diverse set of synthetic images. These programs are short code snippets, which are easy to modify and fast to execute using OpenGL. The proposed dataset can be used for both supervised and unsupervised representation learning, and reduces the gap between pre-training with real and procedurally generated images by 38%.
研究动机与目标
- 解决现有合成数据方法依赖少量精心设计的专家生成过程所带来的局限性。
- 探究扩大程序化图像生成程序数量是否能显著提升表征学习性能。
- 开发一种可扩展、高吞吐量的框架,利用简短的可执行代码片段生成多样化合成图像。
- 识别能最大化下游表征质量的有效程序化图像生成程序的特性。
- 证明程序化数据可实现与真实图像预训练相媲美甚至更优的性能,尤其是在分布外设置下。
提出的方法
- 收集21,000个简短的OpenGL片段着色器程序,每个程序生成一组包含简单形状和纹理的多样化合成图像。
- 利用高吞吐量GPU渲染(每秒数百帧)在训练期间实时生成图像,实现高效的数据流水线集成。
- 在生成的图像上使用监督和自监督表征学习(例如SimCLR、线性探测)训练神经网络。
- 将每个独特的着色器作为离散的潜在类别用于监督学习,避免对生成参数进行临时聚类。
- 训练一个轻量级预测模型,基于图像级统计量(如LPIPS、压缩率、FID)估计未见着色器的下游性能。
- 利用该预测模型以贪婪、数据高效的方式指导高绩效着色器的选择,用于下游评估。
实验结果
研究问题
- RQ1程序化图像生成程序的数量如何与下游表征学习性能相关联?
- RQ2一个大规模、未经筛选的程序化着色器数据集是否能超越依赖专家设计生成过程的现有合成数据方法?
- RQ3哪些图像级属性(如多样性、自相似性、色彩变化)与程序化图像生成中的高性能相关?
- RQ4学习到的预测模型是否能有效识别高绩效着色器而无需完整训练,从而实现高效的数据选择?
- RQ5高性能着色器与低性能着色器在结构和纹理方面的视觉特征有何差异?
主要发现
- 下游性能随程序化图像生成程序数量的增加呈对数增长,表明更大的程序集合仍能带来持续提升。
- 使用ResNet-50进行线性分类时,所提出的Shaders-21k数据集在ImageNet-1k上达到36%的top-1准确率,比最佳先前方法(Shaders-1k)高出10个百分点。
- 使用MixUp训练时,利用Shaders-21k将真实图像预训练(Places365)与程序化生成图像之间的性能差距缩小了38%。
- 自相似性较高的着色器(以LPIPS图像内相似度衡量)往往表现较差,表明图像多样性是表征质量的关键驱动因素。
- 在FID和gzip压缩率之间存在显著的帕累托前沿:高性能着色器无法同时实现低FID和低压缩率。
- 基于学习到的性能预测器进行贪婪选择的着色器显著优于随机选择,表现最好的预测着色器达到了36%的top-1准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。