Skip to main content
QUICK REVIEW

[论文解读] 3DViewGraph: Learning Global Features for 3D Shapes from A Graph of Unordered Views with Attention

Zhizhong Han, Xiyang Wang|arXiv (Cornell University)|May 17, 2019
3D Shape Modeling and Analysis参考文献 20被引用 9
一句话总结

3DViewGraph 提出了一种基于图的深度学习框架,通过注意力机制有效聚合无序多视角图像,学习全局3D形状特征。通过将视角建模为全连接图中的节点,并利用潜在语义映射和空间模式相关性编码内容与空间关系,该方法在三个大规模基准数据集上的3D形状分类与检索任务中均达到最先进性能。

ABSTRACT

Learning global features by aggregating information over multiple views has been shown to be effective for 3D shape analysis. For view aggregation in deep learning models, pooling has been applied extensively. However, pooling leads to a loss of the content within views, and the spatial relationship among views, which limits the discriminability of learned features. We propose 3DViewGraph to resolve this issue, which learns 3D global features by more effectively aggregating unordered views with attention. Specifically, unordered views taken around a shape are regarded as view nodes on a view graph. 3DViewGraph first learns a novel latent semantic mapping to project low-level view features into meaningful latent semantic embeddings in a lower dimensional space, which is spanned by latent semantic patterns. Then, the content and spatial information of each pair of view nodes are encoded by a novel spatial pattern correlation, where the correlation is computed among latent semantic patterns. Finally, all spatial pattern correlations are integrated with attention weights learned by a novel attention mechanism. This further increases the discriminability of learned features by highlighting the unordered view nodes with distinctive characteristics and depressing the ones with appearance ambiguity. We show that 3DViewGraph outperforms state-of-the-art methods under three large-scale benchmarks.

研究动机与目标

  • 解决深度学习模型中视图池化方法的局限性,该方法会丢弃多张无序3D形状视角的内容与空间关系信息。
  • 通过同时保留视图内内容与视图间空间关系,提升全局3D形状特征的判别能力。
  • 开发一种可学习的机制,用于聚合无序视角,而无需依赖显式的视角排序或聚类。
  • 引入一种新颖的注意力机制,突出显示具有特征性的视角,抑制模糊视角,以获得更优的特征表示。
  • 通过建模视图为具有内容感知与空间敏感性的节点交互图,实现有效的全局特征学习。

提出的方法

  • 将3D形状的多张无序2D视角表示为全连接视图图中的节点,其中每个视角为一个节点,所有节点两两相连。
  • 应用一种新颖的潜在语义映射,利用学习到的核函数将低层次视角特征投影到低维空间,以捕捉与潜在语义模式的相似性。
  • 引入一种空间模式相关性机制,利用节点的潜在语义嵌入编码每对视角节点之间的内容与空间关系。
  • 利用一种新颖的图注意力机制,动态计算视角对之间的注意力权重,强调信息量丰富的视角并抑制模糊视角。
  • 使用学习到的注意力权重聚合所有空间模式相关性,生成最终的、高度判别性的全局3D形状特征向量。
  • 在大规模3D形状基准数据集上,使用标准分类与检索损失函数端到端训练模型。

实验结果

研究问题

  • RQ1基于图的注意力机制能否有效聚合无序2D视角,从而学习到比传统池化方法更具判别性的全局3D形状特征?
  • RQ2学习到的潜在语义空间在无需对整个训练集进行显式挖掘的情况下,能否有效捕捉低层次视角特征中的有意义语义模式?
  • RQ3与忽略空间结构的方法相比,编码视角对之间的内容与空间关系在多大程度上提升了特征质量?
  • RQ4基于注意力的视角选择能否通过聚焦于具有独特特征的视角并抑制模糊视角,增强特征的判别能力?
  • RQ5在标准基准下,3DViewGraph 在3D形状分类与检索任务中与最先进方法相比表现如何?

主要发现

  • 在 ModelNet40 的 test-test 划分下,3DViewGraph 达到 90.54% 的平均精度(mAP),在 ModelNet10 上达到 92.40%,显著优于所有先前的 SOTA 方法。
  • 在 ShapeNetCore55 上,3DViewGraph 的 mAP 达到 0.8492,NDCG@N 达到 0.9054,较第二名方法(Taco)在 mAP 上高出超过 10 个百分点。
  • 在普林斯顿形状基准(Princeton Shape Benchmark, PSB)上,3DViewGraph 展现出更优的检索性能,其精度与召回率均高于现有基于图的多视角学习方法。
  • 可视化分析表明,注意力机制能够正确识别并突出显示最具特征性的视角(如圆锥或桌子的独特视角),同时抑制模糊视角(如马桶的正面前瞻矩形)。
  • 消融实验表明,若移除潜在语义映射或注意力机制,性能将显著下降,验证了二者在模型中的关键作用。
  • 3DViewGraph 在不同设置下表现出良好的泛化能力,在 ModelNet40 的 all-all 划分下达到 98.75% 的 mAP,表明其具备强大的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。