[论文解读] Recurrent Multi-view Alignment Network for Unsupervised Surface Registration
该论文提出RMA-Net,一种用于无监督非刚性表面配准的循环多视角对齐网络。它将非刚性形变表示为K个刚性变换的逐点组合,并使用可微分的多视角2D深度损失实现端到端训练,无需真实标签,在多个数据集上实现了大规模和细粒度形变的最先进性能。
Learning non-rigid registration in an end-to-end manner is challenging due to the inherent high degrees of freedom and the lack of labeled training data. In this paper, we resolve these two challenges simultaneously. First, we propose to represent the non-rigid transformation with a point-wise combination of several rigid transformations. This representation not only makes the solution space well-constrained but also enables our method to be solved iteratively with a recurrent framework, which greatly reduces the difficulty of learning. Second, we introduce a differentiable loss function that measures the 3D shape similarity on the projected multi-view 2D depth images so that our full framework can be trained end-to-end without ground truth supervision. Extensive experiments on several different datasets demonstrate that our proposed method outperforms the previous state-of-the-art by a large margin. The source codes are available at https://github.com/WanquanF/RMA-Net.
研究动机与目标
- 为解决在无对应标签的情况下训练深度网络进行非刚性表面配准的挑战。
- 通过将高维形变解空间表示为少量刚性变换的组合,降低其维度。
- 设计一种可微分的自监督损失函数,通过多视角深度图像相似性实现端到端训练。
- 在大规模和细粒度形变(包括真实扫描数据和面部表情)上实现鲁棒配准。
- 通过将框架扩展至刚性配准并取得具有竞争力的性能,证明其泛化能力。
提出的方法
- 将非刚性形变表示为K个刚性变换的逐点加权组合,其中K相对于表面点数较小。
- 采用循环神经网络在每一步迭代中估计变换权重和刚性分量,降低每步计算复杂度。
- 使用软光栅化将3D表面投影为多视角2D深度图和掩码,以保证可微分性。
- 基于源和目标投影之间的深度与掩码相似性,定义一种可微分的多视角对齐损失。
- 仅使用多视角损失,无需真实对应关系,实现整个网络的无监督端到端训练。
- 使用软光栅化将点云渲染为可微分的深度图和掩码,用于损失计算。
实验结果
研究问题
- RQ1循环网络能否通过迭代优化刚性变换分量,有效学习复杂的非刚性形变?
- RQ2在无真实标签的情况下,多视角2D深度图像相似性能否作为3D非刚性配准的强可微分监督信号?
- RQ3所提出的刚性变换逐点组合方法是否在约束解空间的同时具备足够的表达能力?
- RQ4该方法能否泛化至大规模、细粒度形变以及真实扫描数据,而不仅限于合成基准?
- RQ5在非刚性与刚性配准设置下,该方法与监督和无监督基线相比表现如何?
主要发现
- 在FaceWareHouse数据集上,RMA-Net在所有方法中实现了最低的EMD(0.0024)和MSE(0.0008),且是唯一能成功闭合张开的嘴巴的方法。
- 在DFAUST数据集上,RMA-Net实现了0.24×10⁻⁴的Chamfer Distance,显著优于3D-Coded(0.43×10⁻⁴),并成功保留了精细的几何细节。
- 在ModelNet40的刚性配准任务中,RMA-Net在无监督设置下实现了1.287的RMSE(R),在有监督变体中为0.735,优于ICP、Go-ICP、FGR和DCP。
- 消融实验表明,循环结构和多视角损失均至关重要,任一组件的移除均导致性能显著下降。
- 该方法成功实现了具有挑战性的大规模形变配准,包括全身和面部表情,而先前方法无法捕捉高精度细节。
- 可微分的多视角损失在驱动网络收敛至精确解方面,优于Chamfer Distance和Earth Mover’s Distance等标准度量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。