Skip to main content
QUICK REVIEW

[论文解读] Pixel2Mesh++: Multi-View 3D Mesh Generation via Deformation

Chao Wen, Yinda Zhang|arXiv (Cornell University)|Aug 5, 2019
Advanced Vision and Imaging被引用 9
一句话总结

该论文提出 Pixel2Mesh++,一种图卷积网络,通过利用跨视角感知特征统计量,迭代地对初始粗略网格进行形变,从而提升从多视角图像生成3D网格的性能。受多视角几何启发,该方法采用可微分的软argmax和统计特征池化,实现端到端训练,实现了最先进的性能,并在不同类别、视角数量和初始化质量下展现出强大的泛化能力。

ABSTRACT

We study the problem of shape generation in 3D mesh representation from a few color images with known camera poses. While many previous works learn to hallucinate the shape directly from priors, we resort to further improving the shape quality by leveraging cross-view information with a graph convolutional network. Instead of building a direct mapping function from images to 3D shape, our model learns to predict series of deformations to improve a coarse shape iteratively. Inspired by traditional multiple view geometry methods, our network samples nearby area around the initial mesh's vertex locations and reasons an optimal deformation using perceptual feature statistics built from multiple input images. Extensive experiments show that our model produces accurate 3D shape that are not only visually plausible from the input perspectives, but also well aligned to arbitrary viewpoints. With the help of physically driven architecture, our model also exhibits generalization capability across different semantic categories, number of input images, and quality of mesh initialization.

研究动机与目标

  • 解决单视角3D网格生成的局限性,如遮挡区域几何质量差以及在语义类别间泛化能力差的问题。
  • 通过利用已知相机位姿的3至5张输入图像中的跨视角信息,提升形状准确性和视角一致性。
  • 克服单图像模型简单扩展至多视角方法的不足,这些方法未能有效利用多视角相关性。
  • 通过可微分的、受物理启发的形变机制,实现输入视角数量可变的端到端训练,并具备对差初始化的鲁棒性。
  • 实现迭代网格优化,逐步提升几何质量,且无需重新训练。

提出的方法

  • 提出多视角形变网络(MDN),通过从多张输入图像中池化得到的特征,对初始粗略网格进行迭代顶点形变。
  • 使用可微分的3D软argmax来近似形变假设选择中的非可微argmax,从而支持端到端反向传播。
  • 采用统计特征池化(均值、最大值、标准差)实现输入顺序和输入数量的不变性,编码跨视角特征相关性。
  • 引入重采样后的Chamfer距离损失,通过在形变后的面上采样点,更有效地惩罚稀疏或不规则网格区域的误差。
  • 利用图卷积网络(GCN)在网格顶点间传播形变信号,保持网格拓扑结构在优化过程中的稳定性。
  • 通过基于统计的特征聚合而非拼接,支持在单次前向传播中处理任意数量的输入视角。

实验结果

研究问题

  • RQ1能否有效利用多张图像的跨视角信息,超越单视角先验,从而提升3D网格生成性能?
  • RQ2如何设计深度学习模型,使其在保持可微性和泛化能力的前提下,利用多视角约束对粗略网格进行迭代优化?
  • RQ3为确保对不同数量输入视角和差初始化的鲁棒性,需要哪些架构组件?
  • RQ4与直接特征拼接相比,使用多视角感知特征统计量是否能带来更好的语义类别和视角数量间的泛化性能?
  • RQ5通过形变实现的迭代优化是否能显著提升网格质量,相比单步预测方法?

主要发现

  • Pixel2Mesh++ 在 ShapeNet 上达到最先进性能,使用3张输入视角时,F-score(τ) 达到66.48%,F-score(2τ) 达到80.30%,优于先前方法。
  • 随着输入视角数量增加,模型保持一致的性能提升,使用5张视角时,F-score(τ) 达到68.29%,F-score(2τ) 达到81.97%,展现出强大的可扩展性。
  • 重采样后的Chamfer距离损失将Chamfer Distance从0.496(无重采样)降低至0.486,显著提升了网格保真度,尤其在稀疏区域表现更优。
  • 统计特征池化优于拼接方式,F-score(τ) 达到66.48%(而原始特征拼接仅为65.26%),归因于更强的不变性和相关性编码能力。
  • 迭代优化提升了性能,且在三次迭代后指标趋于饱和,表明三次迭代已足够达到最优结果。
  • 模型对噪声或差初始化具有良好的泛化能力——能成功去除随机噪声,并将形变网格对齐至真实标签,证实了对初始化质量的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。