Skip to main content
QUICK REVIEW

[论文解读] CvxNet: Learnable Convex Decomposition

Boyang Deng, Kyle Genova|arXiv (Cornell University)|Sep 12, 2019
3D Shape Modeling and Analysis参考文献 73被引用 7
一句话总结

CvxNet 提出了一种可微分的、自监督的神经网络,用于将 3D 形状分解为少量凸多面体,实现端到端训练,适用于 3D 重建和基于部件的检索等任务。其在多视角深度重建任务中达到最先进性能,并在重建精度和语义一致性方面优于先前方法。

ABSTRACT

Any solid object can be decomposed into a collection of convex polytopes (in short, convexes). When a small number of convexes are used, such a decomposition can be thought of as a piece-wise approximation of the geometry. This decomposition is fundamental in computer graphics, where it provides one of the most common ways to approximate geometry, for example, in real-time physics simulation. A convex object also has the property of being simultaneously an explicit and implicit representation: one can interpret it explicitly as a mesh derived by computing the vertices of a convex hull, or implicitly as the collection of half-space constraints or support functions. Their implicit representation makes them particularly well suited for neural network training, as they abstract away from the topology of the geometry they need to represent. However, at testing time, convexes can also generate explicit representations -- polygonal meshes -- which can then be used in any downstream application. We introduce a network architecture to represent a low dimensional family of convexes. This family is automatically derived via an auto-encoding process. We investigate the applications of this architecture including automatic convex decomposition, image to 3D reconstruction, and part-based shape retrieval.

研究动机与目标

  • 开发一种自监督的、端到端可微的架构,从 3D 形状集合中学习低维凸多面体族。
  • 实现在无人工监督下的自动凸分解,利用凸形状的几何和拓扑特性。
  • 直接从网络输出显式的多边形网格,避免如 Marching Cubes 等计算昂贵的等值面提取。
  • 支持下游应用,如实时物理模拟、从图像进行 3D 重建和语义部件检索。
  • 建立基于部件的表征,捕捉形状间的语义结构,实现形状组件的一致性标注与检索。

提出的方法

  • 网络采用自编码器架构,其中形状编码器将 3D 几何映射为表示凸组件的潜在码。
  • 每个凸体通过一组超平面(半空间约束)隐式表示,使用软最大(LogSumExp)函数实现通过凸定义的梯度传播。
  • 解码器通过使用可微的并集操作组合各凸体的隐式指示函数来重建原始形状。
  • 模型使用多组件损失进行训练:基于符号距离场的重建损失、将预测凸体与真实基本体对齐的引导损失,以及保持几何保真度的局部损失。
  • 网络从原始 3D 数据(体素、点云、深度图或 RGB 图像)端到端训练,无需人工标注的部件标签。
  • 输出为以多边形网格表示的凸多面体集合,可直接用于图形和物理模拟管线,无需额外处理。

实验结果

研究问题

  • RQ1深度学习模型能否仅使用凸基本体,学习到紧凑、解耦且语义有意义的 3D 形状表征?
  • RQ2自监督的、可微分的架构在使用凸分解时,能否从多视角深度图或单张 RGB 图像中有效重建 3D 形状?
  • RQ3CvxNet 学习到的凸分解在不同形状类别间(如椅子腿、桌面)在多大程度上保持了语义一致性?
  • RQ4所学习的凸表征能否支持下游任务,如基于部件的形状检索和物理模拟?
  • RQ5CvxNet 在 3D 重建和凸分解任务中的性能与最先进方法相比如何,特别是在 F-score 和重建精度方面?

主要发现

  • CvxNet 在多视角深度输入重建任务中达到最先进 F-score,定量评估中优于领先方法 OccNet [44]。
  • 该模型在重建精度与基本体数量之间的帕累托最优曲线优于 SIF [21],表明其在紧凑性与保真度之间具有更优的权衡。
  • 通过部件对应进行语义部件标注在 PartNet 数据集上取得高精度,实现了对相似形状部件(如椅子腿)中同一凸组件的一致标注。
  • 网络直接输出显式多边形网格,绕过计算昂贵的等值面提取,可直接用于物理模拟和渲染管线。
  • 消融研究证实,所有损失组件(重建、引导、局部)对有效学习均不可或缺,且模型对瓶颈维度和凸体数量的变化具有鲁棒性。
  • CvxNet 在 RGB 到 3D 重建任务中泛化良好,性能与最先进方法相当,且在未使用模板预训练的情况下,从零开始端到端训练编码器和解码器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。