Skip to main content
QUICK REVIEW

[论文解读] Fine-Grained Stochastic Architecture Search

Shraman Ray Chaudhuri, Elad Eban|arXiv (Cornell University)|Jun 17, 2020
Advanced Neural Network Applications参考文献 41被引用 4
一句话总结

FiGS(细粒度随机架构搜索)提出了一种可微分的、细粒度的神经架构搜索方法,通过逻辑斯蒂- sigmoid 分布施加结构化稀疏正则化,联合选择并修改操作符与特征图,从而探索远超以往可微分 NAS 方法的架构空间。FiGS 在 ImageNet 上实现 SOTA 准确率(260 万参数下 top-1 准确率为 75.4%),并在使用 SSDLite 的 COCO 目标检测任务中 mAP 提升 +4,优于 MobileNetV3 和 MnasNet。

ABSTRACT

State-of-the-art deep networks are often too large to deploy on mobile devices and embedded systems. Mobile neural architecture search (NAS) methods automate the design of small models but state-of-the-art NAS methods are expensive to run. Differentiable neural architecture search (DNAS) methods reduce the search cost but explore a limited subspace of candidate architectures. In this paper, we introduce Fine-Grained Stochastic Architecture Search (FiGS), a differentiable search method that searches over a much larger set of candidate architectures. FiGS simultaneously selects and modifies operators in the search space by applying a structured sparse regularization penalty based on the Logistic-Sigmoid distribution. We show results across 3 existing search spaces, matching or outperforming the original search algorithms and producing state-of-the-art parameter-efficient models on ImageNet (e.g., 75.4% top-1 with 2.6M params). Using our architectures as backbones for object detection with SSDLite, we achieve significantly higher mAP on COCO (e.g., 25.8 with 3.0M params) than MobileNetV3 and MnasNet.

研究动机与目标

  • 为解决现有可微分 NAS 方法因固定操作符集合而仅能探索狭窄架构子空间的局限性。
  • 实现操作符选择与架构修改(如通道剪枝)的联合搜索,以提升表达能力。
  • 在保持或提升模型效率与准确率的前提下,降低搜索成本,适用于多样化的资源约束。
  • 提供即插即用的方案,可应用于任何现有搜索空间,无需重新设计搜索空间。
  • 实现模型大小与 FLOPs/延迟的帕累托效率模型发现,支持在移动设备与边缘设备上的广泛部署。

提出的方法

  • FiGS 引入一种随机掩码机制,其中每个输出通道或神经元被分配一个伯努利掩码,并通过逻辑斯蒂- sigmoid 分布松弛化,以支持可微训练。
  • 该方法基于逻辑斯蒂- sigmoid 分布施加结构化稀疏正则化惩罚,利用梯度下降学习最优掩码概率。
  • 掩码在每层和每个操作后应用,实现对中间特征与操作输出的细粒度控制。
  • 最终架构通过在推理时从学习到的掩码分布中采样生成。
  • 该方法兼容任何现有 DNAS 搜索空间,仅需在每层后插入掩码层即可。
  • FiGS 支持早期停止,仅造成极小的准确率损失,将搜索时间减少最多 5 倍,同时保持高性能。

实验结果

研究问题

  • RQ1通过在优化过程中不仅修改操作符选择,还调整特征图尺寸,可微分 NAS 方法能否显著扩展可探索的架构空间?
  • RQ2当应用于 One-Shot 和 MnasNet 等成熟搜索空间时,FiGS 的性能与原始搜索算法相比如何?
  • RQ3FiGS 在多大程度上能发现模型大小与 FLOPs/延迟的帕累托效率模型?这些权衡在不同搜索空间中如何变化?
  • RQ4FiGS 在从零训练时能否生成 ImageNet 上的 SOTA 小模型?其在目标检测等下游任务中的表现如何?
  • RQ5FiGS 是否能通过早期停止显著降低搜索成本,且不造成显著的准确率下降?

主要发现

  • FiGS 在仅 260 万个参数下,ImageNet 上达到 75.4% 的 top-1 准确率,创下参数效率模型的新 SOTA 记录。
  • 在使用 SSDLite 的 COCO 目标检测任务中,FiGS-One-Shot-Large 达到 25.8 mAP(302 万个参数),优于 MobileNetV3-Large(21.8 mAP)和 MnasNet-A1(23.0 mAP),尽管参数更少。
  • 当应用于 One-Shot 搜索空间时,FiGS 的性能与原始搜索算法相当或更优,证明其在多种搜索空间中具有强大泛化能力。
  • FiGS 可在 40 个周期时实现早期停止,准确率仅比完整训练下降 0.3–0.6%,将搜索时间减少 2.5 倍。
  • 当应用于 ResNet 模型时,FiGS 优于标准剪枝基线,展现出在结构化架构搜索中的卓越性能。
  • 该方法揭示了现有搜索空间中的固有偏差:部分搜索空间更倾向模型大小效率,另一些则更倾向 FLOPs/延迟效率,从而深化了对搜索空间设计权衡的理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。