[论文解读] Auto-MVCNN: Neural Architecture Search for Multi-view 3D Shape Recognition
本文提出 Auto-MVCNN,一种专为多视角 3D 形状识别设计的神经架构搜索框架,可自动设计融合单元以建模视角间特征相关性,并联合优化多任务学习的损失权重。该方法在 ModelNet40 上实现了 94.4% 的准确率和 91.0% 的 mAP,显著优于人工设计的网络,同时减少了参数量和计算成本。
In 3D shape recognition, multi-view based methods leverage human's perspective to analyze 3D shapes and have achieved significant outcomes. Most existing research works in deep learning adopt handcrafted networks as backbones due to their high capacity of feature extraction, and also benefit from ImageNet pretraining. However, whether these network architectures are suitable for 3D analysis or not remains unclear. In this paper, we propose a neural architecture search method named Auto-MVCNN which is particularly designed for optimizing architecture in multi-view 3D shape recognition. Auto-MVCNN extends gradient-based frameworks to process multi-view images, by automatically searching the fusion cell to explore intrinsic correlation among view features. Moreover, we develop an end-to-end scheme to enhance retrieval performance through the trade-off parameter search. Extensive experimental results show that the searched architectures significantly outperform manually designed counterparts in various aspects, and our method achieves state-of-the-art performance at the same time.
研究动机与目标
- 为解决人工设计的 CNN 主干网络在多视角 3D 形状识别中的局限性,这些网络可能并非最优的 3D 特征学习结构。
- 开发一种端到端的神经架构搜索框架,联合优化网络架构与训练损失平衡,以同时支持分类与检索任务。
- 设计一种新型融合单元,可自动捕捉多视角特征之间的内在相关性,提升特征表示能力。
- 通过用搜索得到的架构替代人工设计的网络,降低计算成本与模型复杂度。
- 证明 NAS 优化的网络在 3D 形状基准测试中,相较于 ImageNet 预训练的基线模型,在准确率与效率方面均表现更优。
提出的方法
- 提出一种新型融合单元架构,通过连续松弛处理序列化视角特征,实现对离散操作的基于梯度的搜索。
- 将基于梯度的 DARTS NAS 框架扩展至多视角输入,通过融合单元建模视角间特征依赖关系。
- 引入一种端到端方案,联合搜索三种损失函数的最优权衡参数:形状分类损失、视角分类损失与检索损失。
- 采用共享主干网络进行视角特征提取,随后通过学习到的融合模块与多任务头完成分类与检索任务。
- 使用可微分的搜索空间,通过反向传播实现高效架构搜索,避免强化学习或进化计算。
- 在 ModelNet40 上进行架构搜索与模型训练,最终模型在干净的和受扰动的 ShapeNetCore55 数据集上进行评估。
实验结果
研究问题
- RQ1神经架构搜索能否有效适配多视角 3D 形状识别,以替代人工设计的 CNN 主干网络?
- RQ2如何设计一种可微且高效的融合单元,以自动建模多视角特征之间的相关性?
- RQ3端到端搜索损失权重组合是否能改善多任务 3D 形状识别中的训练平衡与性能表现?
- RQ4NAS 优化的架构是否在 3D 形状分类与检索任务中优于 ImageNet 预训练的基线网络?
- RQ5初始通道数与搜索稳定性如何影响最终架构的性能表现?
主要发现
- Auto-MVCNN 在 ModelNet40 上使用 ImageNet 预训练时达到 94.4% 的 top-1 准确率与 91.0% 的 mAP,显著优于所有人工设计的基线模型。
- 所搜索到的架构 AM_c36 达到 94.4% 的准确率与 91.0% 的 mAP,显著超越 AM_c24(93.9% 准确率,90.9% mAP)及其他 NAS 基线。
- 采用学习操作的融合单元在性能上优于标准单元与其他 NAS 架构,当应用于 AM_c36 时,实现 94.4% 准确率与 91.0% mAP。
- 动态损失权重搜索方案实现 94.4% 准确率与 91.0% mAP,优于固定或人工调优的损失组合。
- 在更具挑战性的 ShapeNetCore55 受扰动数据集上,Auto-MVCNN(AM_c36)实现 91.0% 的 mAP 与 88.9% 的 NDCG,优于所有对比方法。
- 消融实验表明,融合单元与动态损失平衡方案均不可或缺,仅使用融合单元即可使准确率相比标准单元提升 1.0%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。