Skip to main content
QUICK REVIEW

[论文解读] R2-MLP: Round-Roll MLP for Multi-View 3D Object Recognition

Shuo Chen, Tan Yu|arXiv (Cornell University)|Nov 20, 2022
Brain Tumor Detection and Classification被引用 4
一句话总结

本文提出R2-MLP,一种基于MLP的新型多视角3D物体识别架构,引入了环形翻滚(R²)模块,通过沿视角维度移动通道实现跨视角特征通信。通过在视角内结合空间位移操作与跨视角的环形翻滚位移,R2-MLP在ModelNet10(99.6%准确率)和ModelNet40(97.7%准确率)上实现了最先进性能,且参数量更低、推理速度更快,优于基于CNN的模型。

ABSTRACT

Recently, vision architectures based exclusively on multi-layer perceptrons (MLPs) have gained much attention in the computer vision community. MLP-like models achieve competitive performance on a single 2D image classification with less inductive bias without hand-crafted convolution layers. In this work, we explore the effectiveness of MLP-based architecture for the view-based 3D object recognition task. We present an MLP-based architecture termed as Round-Roll MLP (R$^2$-MLP). It extends the spatial-shift MLP backbone by considering the communications between patches from different views. R$^2$-MLP rolls part of the channels along the view dimension and promotes information exchange between neighboring views. We benchmark MLP results on ModelNet10 and ModelNet40 datasets with ablations in various aspects. The experimental results show that, with a conceptually simple structure, our R$^2$-MLP achieves competitive performance compared with existing state-of-the-art methods.

研究动机与目标

  • 为解决现有基于MLP的模型在多视角3D物体识别过程中难以捕捉跨视角依赖关系的局限性。
  • 设计一种高效、无需参数的跨视角特征通信机制,不依赖注意力机制或卷积操作。
  • 在标准基准(ModelNet10和ModelNet40)上,通过纯MLP架构实现最先进性能。

提出的方法

  • R2-MLP架构采用环形翻滚(R²)模块,以循环方式沿视角维度移动部分特征通道,实现相邻视角之间的信息交换。
  • 在每个视角内部,对宽度和高度维度应用空间位移操作,以促进视角内特征通信。
  • R²模块将视角内与跨视角的特征交互整合于单一计算无负担的组件中,避免引入额外参数或FLOPs。
  • 模型使用标准MLP主干网络,结合可学习的线性投影和位置编码,处理多视角特征。
  • 环形翻滚操作实现为循环位移:例如,视角1 → 视角2 → 视角3 → 视角1,使相邻视角能够共享特征。
  • 该架构在3D分类任务上进行端到端训练,并在标准基准上评估分类与检索任务的表现。

实验结果

研究问题

  • RQ1纯MLP架构能否有效建模多视角3D物体识别中的跨视角依赖关系?
  • RQ2环形翻滚特征位移机制与注意力或卷积相比,在促进跨视角通信方面表现如何?
  • RQ3像环形翻滚这样计算无负担、无参数的操作,是否能在降低FLOPs和推理时间的同时实现具有竞争力的性能?
  • RQ4所提出的R2-MLP是否在标准3D识别基准上超越现有的基于CNN和注意力机制的方法?
  • RQ5R2-MLP是否能在未经过直接检索损失优化的情况下,良好泛化至3D形状检索任务?

主要发现

  • 在使用20个视角的ModelNet10上,R2-MLP达到99.6%的top-1准确率,超越所有对比方法,包括CAR-Net。
  • 在使用20个视角的ModelNet40上,R2-MLP达到97.7%的准确率,性能与最先进方法CAR-Net相当,但参数更少、计算量更低。
  • 仅使用12个视角时,R2-MLP在ModelNet40上达到97.2%的准确率,在所有方法中排名第二,展现出在更少视角下的强大泛化能力。
  • 在ModelNet40的3D形状检索任务中,R2-MLP在12个视角下达到93.1%的mAP,在20个视角下也达到93.1%,优于先前最先进方法MLVCNN(92.2% mAP)。
  • 在V100 GPU上,R2-MLP在ModelNet40上的推理速度为每样本0.07秒,显著快于CAR-Net(0.20秒)及其他基于CNN的模型。
  • R2-MLP的FLOPs和参数量均低于基于CNN的同类模型(如CAR-Net),展现出更优的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。