[论文解读] Dominant Set Clustering and Pooling for Multi-View 3D Object Recognition
引入一个递归的主导集合聚类与池化层来融合多视图CNN特征,提升 ModelNet40 上的3D对象识别达到最先进水平。
View based strategies for 3D object recognition have proven to be very successful. The state-of-the-art methods now achieve over 90% correct category level recognition performance on appearance images. We improve upon these methods by introducing a view clustering and pooling layer based on dominant sets. The key idea is to pool information from views which are similar and thus belong to the same cluster. The pooled feature vectors are then fed as inputs to the same layer, in a recurrent fashion. This recurrent clustering and pooling module, when inserted in an off-the-shelf pretrained CNN, boosts performance for multi-view 3D object recognition, achieving a new state of the art test set recognition accuracy of 93.8% on the ModelNet 40 database. We also explore a fast approximate learning strategy for our cluster-pooling CNN, which, while sacrificing end-to-end learning, greatly improves its training efficiency with only a slight reduction of recognition accuracy to 93.3%. Our implementation is available at https://github.com/fate3439/dscnn.
研究动机与目标
- 旨在推动提高多视图3D对象识别,超越 winner-take-all 池化。
- 基于 dominant sets 开发一个视图聚类与池化层,以融合相似视图。
- 通过将该层与预训练的CNN整合实现端到端或快速训练以提高准确性。
提出的方法
- 构建一个视图相似性图,其中节点是视图特征向量(relu 输出),边权重是 CNN 特征的内积。
- 使用基于复制动力学的算法提取 dominant set 以形成连贯的视图簇。
- 在每个 dominant set 内进行池化(最大值或平均值),并将结果回传以进行循环细化,直到簇稳定。
- 在预训练的 VGG-M 网络的 relu6/relu7 之后附接递归聚类与池化层,并执行全步幅池化以生成统一的多视图特征向量。
- 可选通过对递归层周围的 CNN 层进行微调实现端到端训练;快速训练变体为提高效率而省略端到端学习。
- 在RGB的基础上探索额外的特征模态(深度、表面法线)以提高准确性。
实验结果
研究问题
- RQ1基于 dominant set 的聚类是否相比最大池化或对成对视图方法能改善多视图特征融合?
- RQ2递归聚类与池化层能否插入到预训练 CNN 中,从而为多视图识别获得端到端可训练的网络?
- RQ3视图数量和附加模态的加入如何影响 ModelNet40 上的识别性能?
- RQ4在使用快速训练与端到端训练之间,训练效率与准确性之间的权衡是什么?
主要发现
- 在 ModelNet40 上取得最先进的测试准确率,使用 RGB 视图和递归聚类与池化层,达到 93.8% 的 full-set 准确率。
- 对于 RGB 视图,端到端训练的准确性(92.2% full-set)高于快速训练(91.9% full-set)。
- 将深度和表面法线与 RGB 结合,在快速训练下 full-set 准确率提升至 93.3%,在端到端训练变体中达到 93.8%。
- 增加视图数量通常能提升所提出方法的性能,在不同视图数量下对 MVCNN 也有持续的增益。
- 快速训练显著降低每轮成本,与端到端训练相比,准确率仅有微小下降。
- 在可比设置下,该方法超越了最先进的 MVCNN 和相关方法在 ModelNet40 上的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。