[论文解读] ROCA: Robust CAD Model Retrieval and Alignment from a Single Image
ROCA 提出了一种端到端的方法,通过基于密集 2D-3D 对应关系(深度和归一化物体坐标)的可微 Procrustes 优化,从单张 RGB 图像实现鲁棒的 3D CAD 模型检索与 9-DoF 姿态对齐。通过联合学习几何感知嵌入并利用可微对齐优化姿态,ROCA 在 ScanNet 上将检索感知对齐准确率提升至 17.6%,相比 SOTA 提升了 8.1% 的相对性能。
We present ROCA, a novel end-to-end approach that retrieves and aligns 3D CAD models from a shape database to a single input image. This enables 3D perception of an observed scene from a 2D RGB observation, characterized as a lightweight, compact, clean CAD representation. Core to our approach is our differentiable alignment optimization based on dense 2D-3D object correspondences and Procrustes alignment. ROCA can thus provide a robust CAD alignment while simultaneously informing CAD retrieval by leveraging the 2D-3D correspondences to learn geometrically similar CAD models. Experiments on challenging, real-world imagery from ScanNet show that ROCA significantly improves on state of the art, from 9.5% to 17.6% in retrieval-aware CAD alignment accuracy.
研究动机与目标
- 通过轻量级、紧凑的 CAD 模型,从单张 RGB 图像实现对真实世界场景的精确 3D 感知。
- 通过引入可微的、几何感知的优化过程,解决直接姿态回归在 3D 物体对齐中的局限性。
- 通过学习融合 3D 规范坐标与代理形状补全目标的联合嵌入,提升 CAD 检索性能。
- 实现适合交互式应用的实时推理性能。
- 增强对真实图像中噪声或不完美 2D-3D 对应关系的鲁棒性。
提出的方法
- ROCA 使用 Mask R-CNN 主干网络检测并实例分割单张 RGB 图像中的物体。
- 它预测每像素的深度和归一化物体坐标(NOCs),以建立图像区域与规范 3D 物体空间之间的 2D-3D 对应关系。
- 应用可微的 Procrustes 优化,通过最小化预测 2D 投影与 3D 规范点之间的误差,计算 9-DoF 刚性变换(平移与旋转)。
- 该方法在 Procrustes 优化中引入可学习权重,以提升对噪声对应关系的鲁棒性。
- 通过基于 NOC 预测和代理形状补全损失,学习检测物体特征与 CAD 模型之间的联合嵌入空间,以提升检索性能。
- 整个流程端到端训练,实现检测、对应预测、姿态估计与检索的联合优化。
实验结果
研究问题
- RQ1可微的 2D-3D 对应预测是否能提升从单张 RGB 图像进行 3D CAD 模型对齐的准确率?
- RQ2基于 3D 规范坐标与对应预测推导出的几何感知嵌入,是否能增强 CAD 检索性能?
- RQ3检索与对齐的端到端联合优化是否能带来优于解耦方法的对齐准确率?
- RQ4该方法在真实世界数据中面对噪声或不完美的 2D-3D 对应预测时是否具有鲁棒性?
- RQ5该方法能否实现适合交互式应用的实时推理速度?
主要发现
- ROCA 在 ScanNet/Scan2CAD 基准上将检索感知对齐准确率提升至 17.6%,相比之前 SOTA 的 9.5% 显著提升。
- 可微 Procrustes 优化将类别对齐准确率从 14.9% 提升至 19.4%。
- 在 Procrustes 优化中引入可学习权重后,准确率进一步提升至 20.4%。
- 通过基于 NOC 的嵌入空间实现的联合检索学习,使对齐准确率提升至 21.5%。
- 在 NOC 预测中引入模拟高斯噪声时,该方法仍保持基线准确率的 90%(σ=0.3 时)。
- 将训练数据从 25k 帧扩展至 400k 帧,使对齐准确率提升至 24.4%,检索感知对齐准确率提升至 24.9%,表明具有数据效率优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。