[论文解读] Object-Centric Multi-View Aggregation
本文提出一种以物体为中心的多视角聚合方法,无需显式相机位姿估计,即可将稀疏的2D视角提升至规范化的3D坐标系中,通过感知对称性的坐标预测来增强特征传播并解决位姿歧义。该方法学习一种半隐式的3D特征网格表示,实现鲁棒的3D重建与新视角合成,在定性和定量评估中均优于隐式方法和以相机为中心的基线模型。
We present an approach for aggregating a sparse set of views of an object in order to compute a semi-implicit 3D representation in the form of a volumetric feature grid. Key to our approach is an object-centric canonical 3D coordinate system into which views can be lifted, without explicit camera pose estimation, and then combined -- in a manner that can accommodate a variable number of views and is view order independent. We show that computing a symmetry-aware mapping from pixels to the canonical coordinate system allows us to better propagate information to unseen regions, as well as to robustly overcome pose ambiguities during inference. Our aggregate representation enables us to perform 3D inference tasks like volumetric reconstruction and novel view synthesis, and we use these tasks to demonstrate the benefits of our aggregation approach as compared to implicit or camera-centric alternatives.
研究动机与目标
- 为解决从少量2D图像(相机位姿未知)进行3D重建的问题,特别是在在线产品市场等仅提供1至4个视角的场景中。
- 通过引入嵌入几何归纳偏置的以物体为中心的3D坐标系,克服以相机为中心和完全隐式方法的局限性。
- 通过利用物体对称性来增强特征传播并解决位姿歧义,实现在无需相机位姿估计情况下的鲁棒视角聚合。
- 开发一种半隐式的3D表示,将体素化网格与可学习的潜在特征相结合,以支持端到端的下游3D任务训练。
- 在3D重建与新视角合成任务中,相比隐式与以相机为中心的聚合基线,展示出性能的提升。
提出的方法
- 该方法首先使用2D卷积神经网络从输入图像中提取像素级特征,随后在以物体为中心的规范空间中进行感知对称性的3D坐标与置信度图预测。
- 对于每个像素,网络预测其在规范物体空间中的3D坐标及置信度分数,从而实现将2D特征提升至3D体素,同时保持几何结构。
- 感知对称性的提升使模型能够推断出观测区域的对称对应区域,增强特征覆盖范围,并减少遮挡或对称部件带来的歧义。
- 来自多视角的提升特征在规范空间中通过平均进行聚合,随后利用3D-UNet进行优化,生成统一的半隐式3D表示。
- 最终的表示通过特定任务的头部模块支持下游任务,如体素化重建与新视角合成。
- 整个流程采用端到端训练,监督信号来自真实3D形状与渲染图像。
实验结果
研究问题
- RQ1以物体为中心的3D坐标系是否能够在无需显式相机位姿估计的情况下实现有效的多视角聚合?
- RQ2感知对称性的提升如何改善稀疏视角下3D重建的特征传播并减少歧义?
- RQ3具有可学习体素特征的半隐式3D表示是否能在3D推理任务中超越完全隐式或以相机为中心的表示?
- RQ4感知对称性的坐标预测在多大程度上提升了重建质量与新视角合成的保真度?
- RQ5该方法在未标定、稀疏视角与物体掩码的真实数据上是否具备良好的泛化能力?
主要发现
- 所提方法在基准数据集上的3D重建与新视角合成任务中达到最先进性能,相比隐式与以相机为中心的基线,L1误差更低。
- 采用感知对称性的提升显著降低了重建误差并提升了泛化能力,尤其在仅提供1至4个视角时表现更优。
- 梯度反向传播分析表明,模型依赖于跨视角的对称与对应像素,验证了所学习对应机制的有效性。
- 在真实图像(包括旋转物体与在线产品图像)上的定性结果表明,形状重建准确,新视角合成自然合理。
- 通过聚合所有对称提升的特征,该方法能有效解决位姿歧义问题(如区分对称物体的正面与背面)。
- 半隐式的3D表示结合强几何归纳偏置,实现了高保真度的3D推理,优于采用低分辨率隐式特征的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。