[论文解读] Visual Compiler: Synthesizing a Scene-Specific Pedestrian Detector and Pose Estimator
本文提出视觉编译器(Visual Compiler),仅通过单张场景图像、相机参数和几何布局,即可生成针对特定场景的行人检测器与姿态估计算法。通过渲染具有物理真实感、几何一致性的合成行人图像,并附带精确标注,该系统训练了一个空间可变的全卷积神经网络(ScenePoseNet),其在合成与真实测试数据上的表现均优于仅使用真实数据训练的最先进模型,即使完全基于合成数据进行训练亦能实现优异性能。
We introduce the concept of a Visual Compiler that generates a scene specific pedestrian detector and pose estimator without any pedestrian observations. Given a single image and auxiliary scene information in the form of camera parameters and geometric layout of the scene, the Visual Compiler first infers geometrically and photometrically accurate images of humans in that scene through the use of computer graphics rendering. Using these renders we learn a scene-and-region specific spatially-varying fully convolutional neural network, for simultaneous detection, pose estimation and segmentation of pedestrians. We demonstrate that when real human annotated data is scarce or non-existent, our data generation strategy can provide an excellent solution for bootstrapping human detection and pose estimation. Experimental results show that our approach outperforms off-the-shelf state-of-the-art pedestrian detectors and pose estimators that are trained on real data.
研究动机与目标
- 解决在缺乏真实人工标注数据的新监控环境中部署高精度行人检测与姿态估计算法的挑战。
- 通过生成高保真、物理基础的合成数据,消除对真实训练数据的依赖,以用于模型训练。
- 开发一种系统,能够从高层场景规格自动编译出特定场景的视觉程序(深度神经网络)。
- 证明当几何与光照特性准确时,仅使用合成数据训练的模型可超越真实数据训练的模型。
- 实现在无需人工数据采集的前提下,快速部署高精度行人分析系统于新环境。
提出的方法
- 视觉编译器以场景描述(单张图像、相机参数与粗略3D布局)为输入,驱动图形渲染引擎。
- 生成在场景中姿态、服装与3D位置各异的、具有物理真实感且几何准确的合成行人图像。
- 这些图像包含无噪声、精确的标注,涵盖行人检测、身体部位定位与实例分割掩码。
- 使用该合成数据端到端训练一个空间可变的全卷积神经网络(ScenePoseNet),实现行人检测、姿态估计与分割的联合预测。
- 网络采用堆叠的空间信念(SB)单元并引入跳跃连接,以提升特征学习能力与训练稳定性。
- 整个系统完全基于合成数据进行训练,训练过程中未使用任何真实数据,并在真实世界基准上进行评估。
实验结果
研究问题
- RQ1能否仅通过场景几何与相机参数生成的合成数据,有效训练出特定场景的行人检测与姿态估计算法?
- RQ2在检测与姿态估计精度方面,几何与光照准确的合成数据是否优于真实数据训练的模型?
- RQ3利用先验知识对行人姿态与朝向进行采样,对模型性能有何影响?
- RQ4如堆叠的SB单元与跳跃连接等架构组件,对训练与推理有何影响?
- RQ5一个在合成数据上训练的单一统一模型,是否能在无需微调的情况下良好泛化至真实世界测试数据?
主要发现
- ScenePoseNet 仅使用合成数据训练,在 PETS2006 与 Towncenter 数据集上的行人检测与姿态估计任务中,全面超越所有基于真实数据训练的基线模型。
- 在 PETS2006 数据集上,模型达到 85.7% 的平均精度均值(mAP),在 Towncenter 数据集上达到 87.3%,超越当前最先进的真实数据模型。
- 利用先验知识对行人姿态与朝向进行采样,性能优于均匀采样;50,000 张训练图像已足以实现最优性能。
- 增加第二个空间信念(SB)单元显著提升性能,而增加第三个单元仅带来边际增益。
- 跳跃连接对训练稳定性至关重要;未使用跳跃连接的模型无法收敛。
- ScenePoseNet 每帧处理时间为 0.18 秒,速度超过最快基线组合(Faster R-CNN + CPM)的 0.37 秒,提升超过 100%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。