[论文解读] Pose and Shape Estimation with Discriminatively Learned Parts
本文提出了一种统一框架,通过学习与3D关键点对齐的判别性2D部件检测器,并同时优化几何一致性与外观匹配度,实现从单张图像进行3D姿态与形状估计。利用稀疏形状基底和基于ADMM的凸优化,该方法在FG3D Car数据集上实现了最先进性能,姿态估计的平均APD为3.4°,且拟合误差低于先前方法。
We introduce a new approach for estimating the 3D pose and the 3D shape of an object from a single image. Given a training set of view exemplars, we learn and select appearance-based discriminative parts which are mapped onto the 3D model from the training set through a facil- ity location optimization. The training set of 3D models is summarized into a sparse set of shapes from which we can generalize by linear combination. Given a test picture, we detect hypotheses for each part. The main challenge is to select from these hypotheses and compute the 3D pose and shape coefficients at the same time. To achieve this, we optimize a function that minimizes simultaneously the geometric reprojection error as well as the appearance matching of the parts. We apply the alternating direction method of multipliers (ADMM) to minimize the resulting convex function. We evaluate our approach on the Fine Grained 3D Car dataset with superior performance in shape and pose errors. Our main and novel contribution is the simultaneous solution for part localization, 3D pose and shape by maximizing both geometric and appearance compatibility.
研究动机与目标
- 为解决从单张图像联合估计3D姿态与形状的挑战,避免依赖离散姿态聚类或初始姿态估计。
- 学习一种紧凑且具有判别性的2D部件表征,使其对应于3D模型上的3D关键点,以提升泛化能力与鲁棒性。
- 通过平衡几何重投影误差与外观匹配度,同时优化部件定位、3D姿态与形状系数。
- 实现在无需物体类别先验知识或显式3D实例匹配的情况下,实现精确的3D重建与视角估计。
- 通过凸优化形式避免局部极小值,克服RANSAC与非线性优化的局限性。
提出的方法
- 从训练图像中学习判别性2D部件描述符,其中部件以3D模型投影出的3D关键点为中心。
- 使用设施选址优化方法,选择一组最小化但具有最大判别力与覆盖度的代表性3D关键点。
- 通过训练集中提取的基底形状,以稀疏线性组合的方式表示类内形状变化。
- 在测试图像中使用学习到的部件检测器检测多个部件假设,随后通过可见性与邻近性进行剪枝。
- 通过构建凸目标函数,联合优化姿态与形状,最小化几何重投影误差与外观匹配度,采用ADMM求解。
- 将形状系数与3D旋转参数合并为单一矩阵变量,实现联合优化。
实验结果
研究问题
- RQ1是否能够有效将判别性训练的部件模型映射到3D关键点,以实现联合3D姿态与形状估计?
- RQ2如何在不依赖成对约束或离散姿态初始化的前提下,同时优化几何一致性与外观兼容性?
- RQ3稀疏形状基底是否能有效建模类内形状变化,同时实现对未见实例的泛化能力?
- RQ4基于ADMM的凸优化框架是否在避免局部极小值与提升精度方面优于非凸、非线性优化方法?
- RQ5该方法在未见训练阶段的新型物体实例上,其泛化能力达到何种程度?
主要发现
- 在FG3DCar数据集上,该方法的姿态估计平均视角误差为3.4°,在20°与40°离散化方案下均显著优于V-DPM。
- 在52个选定的判别性关键点上,该方法使用形状空间基底实现了14.6像素的平均APD,优于均值形状与类别均值基线。
- 尽管仅在52个自动选择的关键点上进行训练,该方法在全部64个数据集提供的关键点上仍比FG3D方法表现出更低的拟合误差。
- 在皮卡车型上,该方法显著优于FG3D,表明其对具有高形状变化的挑战性物体类别具备鲁棒性。
- 定性结果表明,可在新视角下实现鲁棒的3D线框投影与带纹理的3D重建,证实了姿态与形状恢复的准确性。
- 可见性与邻近性剪枝的使用提升了假设选择的稳定性与准确性,从而增强了最终姿态与形状估计的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。