[论文解读] Pixels, voxels, and views: A study of shape representations for single view 3D object shape prediction
本文提出一种统一的编码器-解码器框架,用于比较体素(voxel)与基于表面(多深度图)的3D形状表征,以及以观察者为中心与以物体为中心的坐标系在单图像3D形状预测中的表现。研究发现,对于新类别,基于表面的表征优于体素;以观察者为中心的预测在泛化到未见物体时表现更优,而以物体为中心的预测则更依赖于类别识别。
The goal of this paper is to compare surface-based and volumetric 3D object shape representations, as well as viewer-centered and object-centered reference frames for single-view 3D shape prediction. We propose a new algorithm for predicting depth maps from multiple viewpoints, with a single depth or RGB image as input. By modifying the network and the way models are evaluated, we can directly compare the merits of voxels vs. surfaces and viewer-centered vs. object-centered for familiar vs. unfamiliar objects, as predicted from RGB or depth images. Among our findings, we show that surface-based methods outperform voxel representations for objects from novel classes and produce higher resolution outputs. We also find that using viewer-centered coordinates is advantageous for novel objects, while object-centered representations are better for more familiar objects. Interestingly, the coordinate frame significantly affects the shape representation learned, with object-centered placing more importance on implicitly recognizing the object category and viewer-centered producing shape representations with less dependence on category recognition.
研究动机与目标
- 系统评估形状表征(体素 vs. 基于表面)与坐标系(以观察者为中心 vs. 以物体为中心)对单视角3D形状预测的影响。
- 探究对象熟悉度(从已知实例到新类别)对不同表征与坐标选择下性能的影响。
- 评估在RGB与深度图像上训练的模型在新类别物体与未见视角下的泛化能力。
- 探索坐标系选择如何影响网络编码器所学习的特征嵌入,特别是与物体分类的关系。
提出的方法
- 所有实验均采用共享的编码器-解码器架构,解码器根据需要修改为预测3D体素或来自不同视角的多个深度图。
- 对于基于表面的预测,模型从输入图像的多个视角生成轮廓图与深度图,随后进行局部配准并合并为点云以实现表面重建。
- 坐标系通过训练与评估期间使用的参考系统控制:以观察者为中心使用输入图像的视角,以物体为中心使用一个与类别对齐的规范姿态。
- 通过体素IoU与基于表面的Chamfer距离两种指标评估性能,以覆盖不同最终表征形式。
- 网络在RGB与深度图像上进行训练与评估,分别设置已知实例、已知实例的新视角与新类别的指标。
- 在以观察者为中心模型的4096维特征嵌入上训练分类器,以评估其在物体识别任务中的实用性。
实验结果
研究问题
- RQ1基于表面的形状表征(多深度图)是否在从单张图像预测3D形状方面优于体素表征,特别是在新类别物体上?
- RQ2以观察者为中心的坐标预测是否比以物体为中心的预测在泛化到新物体与未见视角方面更有效?
- RQ3坐标系的选择如何影响网络在形状预测过程中对物体类别识别的依赖程度?
- RQ4使用RGB或深度图像作为输入是否会影响基于表面与体素表征之间的性能差距?
- RQ5在以观察者为中心的坐标下进行形状预测,是否能比端到端类别分类训练获得更优的下游物体识别特征?
主要发现
- 无论采用何种评估指标,基于表面的表征在新类别物体上的表现显著优于体素表征,原因在于其对高分辨率形状细节的编码更紧凑高效。
- 以观察者为中心的坐标预测在泛化到新物体与未见视角方面表现更优,而以物体为中心的预测在已知实例及熟悉物体的新视角上表现更佳。
- 以物体为中心的模型更依赖于物体类别识别,常为错误类别生成看似合理但错误的形状;而以观察者为中心的模型在类别层面的错误更少。
- 坐标系的选择从根本上改变了网络编码器所学习的特征,以观察者为中心的表征学习到与姿态相关的特征,而以物体为中心的表征学习到与类别相关的特征。
- 在以观察者为中心模型的特征嵌入上训练的分类器,其准确率比在相同数据上端到端训练的ResNet分类器高出1%,表明其在物体识别任务中具有更强的判别能力。
- 尽管定性质量更高,以观察者为中心的预测有时会出现姿态错位(误差15–20度),这可能在形状质量较高的情况下仍降低定量指标表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。