Skip to main content
QUICK REVIEW

[论文解读] Customizable Architecture Search for Semantic Segmentation

Yiheng Zhang, Zhaofan Qiu|arXiv (Cornell University)|Aug 26, 2019
Advanced Neural Network Applications参考文献 37被引用 12
一句话总结

本文提出了一种可定制的神经架构搜索(CAS)方法,这是一种用于语义分割的可微神经架构搜索方法,在用户定义的约束(如推理速度和模型大小)下联合优化网络架构与权重。通过将计算单元建模为可微的有向无环图(DAG),并引入成本感知操作,CAS 在单张 TitanXp GPU 上实现了 108 FPS 的推理速度,Cityscapes 数据集上的 mIoU 达到 72.3%,在准确率与速度方面均优于当前最先进的实时方法。

ABSTRACT

In this paper, we propose a Customizable Architecture Search (CAS) approach to automatically generate a network architecture for semantic image segmentation. The generated network consists of a sequence of stacked computation cells. A computation cell is represented as a directed acyclic graph, in which each node is a hidden representation (i.e., feature map) and each edge is associated with an operation (e.g., convolution and pooling), which transforms data to a new layer. During the training, the CAS algorithm explores the search space for an optimized computation cell to build a network. The cells of the same type share one architecture but with different weights. In real applications, however, an optimization may need to be conducted under some constraints such as GPU time and model size. To this end, a cost corresponding to the constraint will be assigned to each operation. When an operation is selected during the search, its associated cost will be added to the objective. As a result, our CAS is able to search an optimized architecture with customized constraints. The approach has been thoroughly evaluated on Cityscapes and CamVid datasets, and demonstrates superior performance over several state-of-the-art techniques. More remarkably, our CAS achieves 72.3% mIoU on the Cityscapes dataset with speed of 108 FPS on an Nvidia TitanXp GPU.

研究动机与目标

  • 自动化设计轻量化、高性能的语义分割网络,满足真实世界硬件与速度约束。
  • 解决人工设计架构所面临的专家参与度高、缺乏动态部署环境适应性的问题。
  • 实现端到端的最优计算单元搜索,平衡精度、推理速度与模型大小。
  • 验证在 Cityscapes 和 CamVid 等数据集上所学架构的可迁移性。
  • 提供可定制的、可微的搜索框架,支持在边缘设备上实现实时部署。

提出的方法

  • 网络结构由一系列计算单元堆叠而成,每个计算单元被建模为一个可微的有向无环图(DAG),其中节点表示特征图,边表示可学习的操作(如卷积、池化)。
  • 在主干网络后附加一个多尺度单元,通过融合多尺度特征来增强特征表示能力。
  • 搜索过程采用类似 DARTS 的可微架构搜索方法,通过在验证集上进行梯度下降,联合优化单元架构与权重。
  • 每项操作均分配有成本(如 FLOPs、延迟),并在搜索过程中累积,实现约束感知的架构发现。
  • 相同类型的单元(如普通单元或降维单元)共享相同的架构,但使用独立学习的权重,从而减少冗余。
  • 最终架构采用端到端方式训练,基于搜索所得的单元配置,方法在 Cityscapes 和 CamVid 上进行了评估,且满足实时约束。

实验结果

研究问题

  • RQ1可微架构搜索方法能否在用户定义的计算约束下有效生成轻量级语义分割网络?
  • RQ2与人工设计的实时模型相比,搜索所得架构在 mIoU 和推理速度方面的表现如何?
  • RQ3在某一数据集(如 Cityscapes)上学习的网络架构在另一数据集(如 CamVid)上的泛化能力有多强?
  • RQ4搜索空间中引入成本感知操作是否能带来更优的精度与推理效率权衡?
  • RQ5所提出的多尺度单元是否能在不显著增加计算成本的前提下提升特征表示能力?

主要发现

  • CAS-GT+MSCell 在 Cityscapes 测试集上实现了 72.3% 的 mIoU,单张 TitanXp GPU 上推理速度达 108 FPS,精度与速度均优于 BiSeNet-Xception39。
  • 在 CamVid 上,相同架构实现了 71.2% 的 mIoU,推理速度达 169 FPS,mIoU 比 BiSeNet-Res18 提高 2.5%,且显著更快。
  • 与人工设计的多尺度单元相比,该方法在仅增加 5.4ms 推理时间的前提下,mIoU 提升了 3.6%,展现出更优的效率-精度权衡。
  • 搜索过程成功发现了兼具高精度与高效率的架构,相比 ICNet、ENet 和 SQ 等先前的实时模型,性能提升达 1.0% 至 12.2%。
  • 从 Cityscapes 到 CamVid 的架构可迁移性验证了所提方法的泛化能力。
  • 成本感知的搜索机制有效平衡了模型大小与速度,支持在多样化硬件平台上的可定制化部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。