[论文解读] Segmentation and Recovery of Superquadric Models using Convolutional Neural Networks
本文提出一种基于两阶段CNN的方法,用于从3D深度场景中分割并恢复无旋转的超二次曲面模型。首先,Mask-RCNN对类似超二次曲面的结构进行实例分割;随后,专用的CNN回归器从部分、可能被遮挡的数据中估计超二次曲面参数。该方法在重建质量上达到最先进水平,且相比迭代方法提速100倍,实现了实时应用。
In this paper we address the problem of representing 3D visual data with parameterized volumetric shape primitives. Specifically, we present a (two-stage) approach built around convolutional neural networks (CNNs) capable of segmenting complex depth scenes into the simpler geometric structures that can be represented with superquadric models. In the first stage, our approach uses a Mask RCNN model to identify superquadric-like structures in depth scenes and then fits superquadric models to the segmented structures using a specially designed CNN regressor. Using our approach we are able to describe complex structures with a small number of interpretable parameters. We evaluated the proposed approach on synthetic as well as real-world depth data and show that our solution does not only result in competitive performance in comparison to the state-of-the-art, but is able to decompose scenes into a number of superquadric models at a fraction of the time required by competing approaches. We make all data and models used in the paper available from https://lmi.fe.uni-lj.si/en/research/resources/sq-seg.
研究动机与目标
- 为解决使用可解释、参数化的超二次曲面基元高效表示复杂3D深度场景的挑战。
- 降低在多物体场景中进行超二次曲面恢复的计算负担,此类任务通常因迭代方法的计算开销过大而难以实现。
- 开发一种深度学习解决方案,将实例分割与参数估计整合到单一端到端流水线中,以提升效率。
- 实现在不完整或部分遮挡的深度数据中稳健恢复超二次曲面,此类情况在真实场景中普遍存在。
- 为机器人、自主系统和3D场景理解提供一种快速、可扩展的替代方案,以替代当前最先进的迭代超二次曲面拟合技术。
提出的方法
- 采用两阶段流水线:首先,Mask-RCNN在深度图像中对类似超二次曲面的结构执行实例分割。
- 将分割区域作为输入,送入一个专用的CNN回归器,该回归器经过训练可从部分深度数据中预测10个超二次曲面参数(位置、尺寸和形状系数)。
- CNN回归器在带有受控遮挡的合成数据上进行训练,以提升对不完整或噪声输入的鲁棒性。
- 该方法假设为无旋转超二次曲面,从而简化参数空间,实现更快的推理速度。
- 该方法利用CNN的空间特征学习归纳偏置,使模型能在多样化的深度场景中实现良好泛化。
- 整个流水线在合成数据和真实世界深度数据(包括真实物体的扫描测距图像)上进行训练和评估。
实验结果
研究问题
- RQ1基于Mask-RCNN的实例分割模型是否能有效识别深度图像中部分被遮挡的类似超二次曲面的结构?
- RQ2CNN回归器是否能从不完整深度数据中准确估计超二次曲面参数,且性能可与最先进迭代方法相媲美?
- RQ3所提出的两阶段CNN流水线是否显著快于现有迭代超二次曲面拟合方法?
- RQ4当单个场景中的超二次曲面数量增加时,该方法的性能如何退化?
- RQ5该方法在真实世界深度数据(包括含噪声和复杂几何结构的扫描测距图像)上的泛化能力如何?
主要发现
- 所提方法在所有测试图像上的像素级重建差异平均绝对误差(MAE)为2.79,与[12, 10]中报道的最先进方法(MAE为1.78)相当。
- 尽管重建误差略高,但该方法相比迭代最先进方法提速100倍,单张图像在GPU上处理时间仅为0.11秒。
- 在单线程CPU上,该方法每张图像仍可在约5秒内完成,显著优于迭代方法10秒的收敛时间。
- 参数预测的误差分布主要集中于均值附近,位置参数的方差较低,表明定位结果具有一致性。
- 当超二次曲面数量增加时,误差分布呈现重尾特征,主要源于重叠或间距较近物体的分割错误。
- Mask-RCNN预测掩码的IoU分布随物体数量增加而愈发偏斜,证实分割性能随场景复杂度提升而下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。