[论文解读] Prior-Aware Synthetic Data to the Rescue: Animal Pose Estimation with Very Limited Real Data
本文提出 PASyn,一种先验感知的合成数据生成流程,利用变分自编码器(VAE)生成概率上有效的合成动物姿态数据(SynAP),并通过风格迁移将合成图像与真实背景对齐。在仅使用 99 张真实斑马图像微调的情况下,采用 SynAP 的模型实现了最先进姿态估计精度,显著提升了极端数据稀缺条件下的肢体关键点预测性能。
Accurately annotated image datasets are essential components for studying animal behaviors from their poses. Compared to the number of species we know and may exist, the existing labeled pose datasets cover only a small portion of them, while building comprehensive large-scale datasets is prohibitively expensive. Here, we present a very data efficient strategy targeted for pose estimation in quadrupeds that requires only a small amount of real images from the target animal. It is confirmed that fine-tuning a backbone network with pretrained weights on generic image datasets such as ImageNet can mitigate the high demand for target animal pose data and shorten the training time by learning the the prior knowledge of object segmentation and keypoint estimation in advance. However, when faced with serious data scarcity (i.e., $<10^2$ real images), the model performance stays unsatisfactory, particularly for limbs with considerable flexibility and several comparable parts. We therefore introduce a prior-aware synthetic animal data generation pipeline called PASyn to augment the animal pose data essential for robust pose estimation. PASyn generates a probabilistically-valid synthetic pose dataset, SynAP, through training a variational generative model on several animated 3D animal models. In addition, a style transfer strategy is utilized to blend the synthetic animal image into the real backgrounds. We evaluate the improvement made by our approach with three popular backbone networks and test their pose estimation accuracy on publicly available animal pose images as well as collected from real animals in a zoo.
研究动机与目标
- 为解决动物姿态估计中严重的数据稀缺问题,特别是针对真实标注数据有限的物种。
- 开发一种成本低廉、个性化的合成数据生成流程,以保持解剖学上的合理性与领域一致性。
- 通过风格迁移和概率姿态建模,减少合成数据与真实图像之间的域偏移。
- 在多种主干网络和真实世界动物园数据集上验证合成数据的有效性。
- 发布一个全新的高质量合成动物姿态数据集(SynAP)以及一个真实动物园斑马数据集,供公众使用。
提出的方法
- 在动画 3D 动物模型上训练变分自编码器(VAE),以生成多样化且解剖学上合理的合成姿态。
- VAE 学习姿态分布的潜在空间,通过控制方差(σ² = 2I)提升姿态多样性与鲁棒性。
- 使用真实纹理生成合成图像,并通过风格迁移模型(StyTr2)将其适配至真实世界背景。
- 通过外观与姿态真实感的联合优化,最小化真实与合成数据之间的分布偏移,确保领域对齐。
- 该方法被用于生成 SynAP(3,000 张斑马图像)和 SynAP+(3,000 张斑马 + 2,000 张其他六种四足动物图像),以实现数据增强。
- 在小规模真实数据集(如 99 张斑马图像)上,使用与不使用合成数据对模型进行微调,以评估性能提升。
实验结果
研究问题
- RQ1基于 VAE 的合成数据生成流程能否在极端数据稀缺条件下生成逼真且多样的动物姿态,从而提升姿态估计性能?
- RQ2风格迁移是否能有效减少动物姿态估计中合成图像与真实图像之间的域偏移?
- RQ3与真实数据相比,SynAP 和 SynAP+ 的合成数据在提升关键点准确率方面表现如何,特别是在灵活肢体的预测上?
- RQ4该方法能否在仅使用极少真实数据的情况下,泛化至未见过的物种和真实世界动物园环境?
- RQ5VAE 采样方差(σ²)对姿态估计模型的鲁棒性与准确率有何影响?
主要发现
- 在仅 99 张真实斑马图像加上 SynAP(3,000 张合成斑马图像)上微调 HRNet-w32 模型,在 Zebra-300 测试集上达到 92.4% 的平均 PCK@0.05 准确率,优于在 8,000 张真实图像上训练但未使用合成数据的模型。
- 消融实验证实,PASyn 中同时使用 VAE 和风格迁移在 Zebra-300 数据集上将平均 PCK@0.05 提升 13.5%(46.6 vs. 33.1),显著优于基线。
- 当完全不使用真实斑马图像时,仅使用 SynAP 训练的模型仍达到 88.2% 的平均 PCK@0.05,证明模型具备利用合成数据泛化至未见物种的能力。
- 在消融实验中,提高 VAE 采样分布方差(σ² = 2I)可提升姿态多样性,使平均准确率比 σ² = I 提高 1.1%。
- 使用 SynAP+(包含 6 种其他四足动物)与 8,000 张真实动物图像联合训练的模型,在测试中达到 94.2% 的平均 PCK@0.05,表明跨物种数据增强具有显著优势。
- 该方法在多种主干网络和真实世界动物园数据集上均达到最先进性能,证实其在数据稀缺条件下的泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。