[论文解读] 3D Pose Estimation for Fine-Grained Object Categories
本文提出一个大规模的细粒度物体类别3D姿态估计数据集(StanfordCars 和 CompCars),包含详细的3D CAD模型和2D-3D姿态标注。提出一种端到端的Faster/Mask R-CNN框架,通过引入3D位置场——一种密集的3D表示方法,利用合成数据提升姿态估计性能,实现无需关键点监督的最先进性能。
Existing object pose estimation datasets are related to generic object types and there is so far no dataset for fine-grained object categories. In this work, we introduce a new large dataset to benchmark pose estimation for fine-grained objects, thanks to the availability of both 2D and 3D fine-grained data recently. Specifically, we augment two popular fine-grained recognition datasets (StanfordCars and CompCars) by finding a fine-grained 3D CAD model for each sub-category and manually annotating each object in images with 3D pose. We show that, with enough training data, a full perspective model with continuous parameters can be estimated using 2D appearance information alone. We achieve this via a framework based on Faster/Mask R-CNN. This goes beyond previous works on category-level pose estimation, which only estimate discrete/continuous viewpoint angles or recover rotation matrices often with the help of key points. Furthermore, with fine-grained 3D models available, we incorporate a dense 3D representation named as location field into the CNN-based pose estimation framework to further improve the performance. The new dataset is available at www.umiacs.umd.edu/~wym/3dpose.html
研究动机与目标
- 解决细粒度物体类别(如汽车品牌和型号)缺乏大规模3D姿态数据集的问题。
- 实现在无需2D/3D关键点监督的前提下,从单张RGB图像中进行完整视角的3D姿态估计。
- 通过将密集3D表示(3D位置场)整合到端到端深度学习框架中,提升姿态估计的准确性。
- 通过利用从细粒度3D CAD模型生成的合成数据,缓解数据稀缺和域差距问题。
- 建立一个基于高质量、类别特定3D模型和标注姿态的细粒度3D姿态估计基准。
提出的方法
- 作者在StanfordCars和CompCars数据集中增补了细粒度3D CAD模型,并为每张图像手动标注3D姿态参数,共获得超过20,000张图像,涵盖309个类别。
- 在Faster/Mask R-CNN基础上引入级联检测与姿态估计头,联合回归目标检测与3D姿态参数。
- 提出一种新颖的3D位置场表示方法,将每个像素映射到物体表面的3D坐标,实现密集的3D形状监督。
- 利用真实图像数据端到端回归位置场,同时通过基于四元数的回归头从回归后的位置场中预测姿态。
- 利用从3D CAD模型生成的合成数据预训练位置场网络,以减小域差距并提升泛化能力。
- 在真实数据上对框架进行微调,并应用从StanfordCars到CompCars的迁移学习,以缓解数据稀缺问题。
实验结果
研究问题
- RQ1仅依靠外观线索,能否在无需关键点监督的情况下,仅从单张RGB图像实现完整的3D视角姿态估计?
- RQ2在端到端深度学习框架中,密集3D表示(3D位置场)在提升3D姿态估计准确性方面的有效性如何?
- RQ3从细粒度3D CAD模型生成的合成数据在多大程度上能减少域差距,并提升在真实图像上的性能?
- RQ4从更大、更详细的数据库(StanfordCars)进行迁移学习,是否能提升在更小、更不详细的数据库(CompCars)上的性能?
- RQ5单一模型能否在具有不同姿态、尺度和视角的多样化细粒度类别中实现良好泛化?
主要发现
- 在StanfordCars 3D数据集上,该方法实现了5.68°的中值旋转误差和0.0834的中值ADD误差,相比基线模型精度提升15%。
- 在CompCars 3D数据集上,当从StanfordCars预训练模型微调后,该方法实现了4.74°的中值旋转误差和0.0836的中值ADD误差,表现出优异的迁移能力。
- 3D位置场的引入使StanfordCars上的$Acc_{\frac{\tau}{6}}$提升2.2%,CompCars上提升4.6%,证明其在形状监督方面的有效性。
- 在CompCars上,当使用位置场进行微调时,模型在$Acc_{\text{th}=0.1}$上达到64.01%,显著优于基线模型(32.52%),表现出对姿态变化的鲁棒性。
- 失败案例主要源于尺度估计误差、严重的透视失真以及训练样本不足的罕见姿态,表明这些方面仍有改进空间。
- 消融实验证实,结合位置场的合成数据预训练能显著提升泛化能力,尤其在低数据场景下效果更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。