[论文解读] Combined Depth Space based Architecture Search For Person Re-identification
该论文提出了一种新颖的可微架构搜索框架——联合深度空间(Combined Depth Space, CDS),用于行人重识别(ReID),并引入了一种轻量化、高效的神经网络——CDNet。通过多分支模块实现联合模式学习,并结合Top-k样本搜索策略,CDNet在轻量化模型中实现了最先进性能:在Market1501上达到95.1%的rank-1准确率,参数量仅1.8M,浮点运算量(FLOPs)为955.1M,其速度与精度均优于更大的主干网络及现有轻量化模型。
Most works on person re-identification (ReID) take advantage of large backbone networks such as ResNet, which are designed for image classification instead of ReID, for feature extraction. However, these backbones may not be computationally efficient or the most suitable architectures for ReID. In this work, we aim to design a lightweight and suitable network for ReID. We propose a novel search space called Combined Depth Space (CDS), based on which we search for an efficient network architecture, which we call CDNet, via a differentiable architecture search algorithm. Through the use of the combined basic building blocks in CDS, CDNet tends to focus on combined pattern information that is typically found in images of pedestrians. We then propose a low-cost search strategy named the Top-k Sample Search strategy to make full use of the search space and avoid trapping in local optimal result. Furthermore, an effective Fine-grained Balance Neck (FBLNeck), which is removable at the inference time, is presented to balance the effects of triplet loss and softmax loss during the training process. Extensive experiments show that our CDNet (~1.8M parameters) has comparable performance with state-of-the-art lightweight networks.
研究动机与目标
- 设计一种轻量化、计算高效且专为ReID优化的神经架构,以克服使用ResNet等ImageNet预训练主干网络所带来的局限性。
- 解决现有NAS搜索空间效率低下且设计欠佳的问题,这些空间未能显式建模行人图像中常见的联合模式特征。
- 通过引入Top-k样本搜索策略,选择性地计算高概率架构路径,从而降低搜索成本并避免陷入局部最优。
- 通过提出一种可移除的细粒度平衡颈部(FBLNeck),实现三元组损失与Softmax损失之间的优化平衡,提升训练稳定性和性能。
- 通过在ImageNet和边缘部署场景下进行分辨率与宽度缩放的评估,验证CDNet的可迁移性与鲁棒性。
提出的方法
- 提出一种新颖的搜索空间——联合深度空间(CDS),其中每个单元使用一种联合块(CBlock),通过两个不同卷积核大小的并行分支,显式学习行人图像中的多尺度联合模式特征。
- 引入Top-k样本搜索策略,在前向传播过程中仅计算权重最高的k个操作,从而降低搜索成本并避免过早收敛至局部最优。
- 设计一种逐层架构搜索策略,允许每层独立搜索其单元结构,实现深度特定的模式学习,与以往方法在各层复用相同单元的设计形成对比。
- 开发一种细粒度平衡颈部(FBLNeck),一种可移除的颈部模块,通过基于条带的局部特征融合机制,平衡三元组损失与Softmax损失之间的冲突优化目标。
- 采用可微架构搜索(DARTS)方法,并引入改进的搜索目标,联合优化三元组损失与Softmax损失。
- 通过宽度缩放因子β和分辨率缩放因子γ对CDNet进行缩放,以适应边缘设备部署,实现对低资源环境的高效适配。
实验结果
研究问题
- RQ1是否可通过为行人图像中的联合模式特征专门设计的搜索空间,提升ReID性能,相较于标准NAS搜索空间?
- RQ2Top-k样本搜索策略是否能通过避免依赖单一高概率路径,降低搜索成本并提升搜索质量?
- RQ3可移除的FBLNeck是否能有效平衡三元组损失与Softmax损失的优化,从而提升ReID任务中的泛化能力?
- RQ4所搜索得到的CDNet在准确率、参数量和FLOPs方面,与现有轻量化ReID模型相比表现如何?
- RQ5尽管CDNet仅在ReID任务上进行训练,其在其他任务(如ImageNet分类)上的泛化能力如何?
主要发现
- CDNet在仅1.8M参数和955.1M FLOPs下,于Market1501上实现95.1%的rank-1准确率和86.0%的mAP,优于参数量更大的模型(如BagofTrick,25.1M参数)和现有轻量化模型(如OSNet,2.2M参数),在准确率与推理速度上均表现更优。
- Top-k样本搜索策略在降低搜索成本的同时避免了陷入局部最优,实现了对CDS搜索空间的有效探索。
- FBLNeck在插入OSNet后显著提升性能,提高mAP与rank-1准确率,且可在推理阶段移除以减小模型尺寸。
- CDNet在ImageNet上表现出良好泛化能力,参数量少于MobileNetV2,top-1准确率达到75.1%,分别超越DARTS与GDAS 1.8%和1.1%。
- 通过宽度因子β与分辨率因子γ对CDNet进行缩放,可保持优异性能:在β=0.25, γ=0.5时,rank-1为91.7%,mAP为79.7%;在β=0.25, γ=1.0时,同样达到91.7%/79.7%的性能,仅需0.1M参数与77.9M FLOPs。
- CDNet展现出强大的边缘部署潜力,在RTX 2080上的推理时间仅为142.4ms,显著快于精度相近或更高的其他模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。