Skip to main content
QUICK REVIEW

[论文解读] PSP-HDRI$+$: A Synthetic Dataset Generator for Pre-Training of Human-Centric Computer Vision Models

Salehe Erfanian Ebadi, Saurav Dhakad|arXiv (Cornell University)|Jul 11, 2022
Video Surveillance and Tracking Methods被引用 12
一句话总结

PSP-HDRI$^+$ 是一种完全可操控的、保护隐私的合成数据生成器,专为以人为中心的计算机视觉设计,在预训练中表现优于 ImageNet 和其他大规模合成数据集。通过采用 SMAA、Poly Haven 遮挡物和自适应标注等技术提升视觉保真度、标签对齐度和领域随机化,该方法使模型在分布内和分布外基准测试中泛化能力更强,尤其在少样本和小样本设置下表现优异。

ABSTRACT

We introduce a new synthetic data generator PSP-HDRI$+$ that proves to be a superior pre-training alternative to ImageNet and other large-scale synthetic data counterparts. We demonstrate that pre-training with our synthetic data will yield a more general model that performs better than alternatives even when tested on out-of-distribution (OOD) sets. Furthermore, using ablation studies guided by person keypoint estimation metrics with an off-the-shelf model architecture, we show how to manipulate our synthetic data generator to further improve model performance.

研究动机与目标

  • 为解决以人为中心的计算机视觉中真实数据集存在的伦理问题、标注偏差和高昂创建成本等局限性。
  • 开发一种完全可操控、保护隐私且伦理合规的合成数据生成器,以缩小合成数据与真实数据之间的领域差距。
  • 证明通过朴素方式生成的合成数据可在性能上超越通用通用预训练数据集(如 ImageNet),尤其是在少样本和分布外设置下。
  • 识别并验证一种稳健的预训练与微调策略,以最大化迁移学习性能,且无需大量超参数调优。

提出的方法

  • 该方法基于 PeopleSansPeople (PSP) 的 Unity 仿真环境构建,并通过提升视觉保真度和标注精度进行扩展。
  • 在光照、相机、姿态、服装和遮挡物位置等方面应用领域随机化,以增强数据多样性并提升模型泛化能力。
  • 关键改进包括使用 Poly Haven 提供的高质量 3D 模型,启用子像素形态抗锯齿(SMAA)以实现更平滑的图形效果,并禁用着色器图随机化以提升真实感。
  • 系统引入标签自适应以匹配目标数据集的分布(如 COCO、MPII),并仅使用简单的动画(行走、奔跑、静止)以降低复杂度,同时保持性能。
  • 消融研究指导了最优配置的选择,最终形成结合所有积极改进的 PSP-HDRI$^+$ 配置。
  • 训练策略采用基于验证性能的自动学习率衰减,无需手动调整超参数。

实验结果

研究问题

  • RQ1合成数据生成器能否在以人为中心的计算机视觉预训练中超越 ImageNet 和其他大规模合成数据集?
  • RQ2使用合成数据进行预训练是否能提升模型在分布外(OOD)基准上的泛化能力,尤其是在低数据量场景下?
  • RQ3特定设计选择(如遮挡物质量、光照随机化、标签自适应)如何影响模型性能与领域差距的减少?
  • RQ4完全可操控的合成数据生成器能否在无需大量超参数调优的情况下实现更优的迁移学习性能?

主要发现

  • 在所有分布内基准测试中,包括 COCO test-dev2017 和 MPII val,基于 PSP-HDRI$^+$ 预训练的模型均优于在 MOTSynth 和 ImageNet 上预训练的模型,边界框平均精度(AP)更高。
  • 在分布外的 MOT17 基准测试中,PSP-HDRI$^+$ 预训练模型达到 32.01 的边界框 AP,显著优于 MOTSynth 预训练模型(13.97),表明其具备更强的领域泛化能力。
  • 在 COCO 上微调后,PSP-HDRI$^+$ 预训练模型在 MOTSynth 上达到 32.46 的 AP,优于仅在 MOTSynth 上微调的模型(32.75),表明 PSP-HDRI$^+$ 提供了更稳健的归纳偏置。
  • 消融研究显示,移除遮挡物/干扰物会降低性能,而其他改进措施(包括 Poly Haven 遮挡物、SMAA 和标签自适应)均提升了零样本性能。
  • 最终的 PSP-HDRI$^+$ 配置结合了标签自适应、高质量遮挡物、SMAA 和简单动画,在多个基准测试中实现了最佳的整体零样本性能。
  • 训练过程中使用随机裁剪增强进一步提升了在 MOTSynth 和 MOT17 上的零样本性能,凸显了数据增强在合成预训练中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。