[论文解读] RepNAS: Searching for Efficient Re-parameterizing Blocks
RepNAS 提出了一种新颖的一阶段神经架构搜索(NAS)框架,可在允许每模块任意分支数量的灵活搜索空间中,搜索高效且可重参数化的多样化分支模块(ODBBs)。通过在内存约束下采用基于梯度的架构搜索、模块级权重共享以及动态剪枝,RepNAS 在 ImageNet 上实现了最先进(SOTA)的准确率,同时推理速度与单路径模型相当,在相似延迟约束下优于人工设计及先前的 NAS 模型。
In the past years, significant improvements in the field of neural architecture search(NAS) have been made. However, it is still challenging to search for efficient networks due to the gap between the searched constraint and real inference time exists. To search for a high-performance network with low inference time, several previous works set a computational complexity constraint for the search algorithm. However, many factors affect the speed of inference(e.g., FLOPs, MACs). The correlation between a single indicator and the latency is not strong. Currently, some re-parameterization(Rep) techniques are proposed to convert multi-branch to single-path architecture which is inference-friendly. Nevertheless, multi-branch architectures are still human-defined and inefficient. In this work, we propose a new search space that is suitable for structural re-parameterization techniques. RepNAS, a one-stage NAS approach, is present to efficiently search the optimal diverse branch block(ODBB) for each layer under the branch number constraint. Our experimental results show the searched ODBB can easily surpass the manual diverse branch block(DBB) with efficient training.
研究动机与目标
- 通过设计与结构重参数化兼容的搜索空间,弥合神经架构搜索(NAS)性能与实际推理速度之间的差距。
- 克服固定、人工设计的多分支模块(如 RepVGG、ACB)因内存占用高且分支配置次优而带来的局限性。
- 实现无需微调的自动端到端最优多样化分支模块(ODBBs)搜索,同时通过单路径融合保持快速推理。
- 开发一种内存高效的训练策略,在反向传播过程中动态剪枝低重要性分支,以在 GPU 内存限制下扩展至更大模型。
提出的方法
- 提出一种新型搜索空间——Rep 搜索空间,其中每个模块在训练期间可独立保留任意数量的分支,并可在推理时融合为单路径。
- 提出 RepNAS,一种一阶段基于梯度的 NAS 方法,通过反向传播中更新的架构参数学习整个分支的重要性(而非单个连接)。
- 在超网络中应用模块级权重共享,以实现高效训练,并在无需微调的情况下实现准确的架构排序。
- 实施内存感知的训练策略:在每次前向传播中,按重要性(由温度控制的门控确定)顺序剪枝低重要性分支,直至满足 GPU 内存限制。
- 采用可微架构搜索(DARTS 风格)并引入温度参数,以软分配分支重要性,从而实现网络参数与架构参数的同时梯度更新。
- 训练完成后,通过将所有高重要性分支融合为单路径模型,获得最终的 ODBB,实现无需微调的直接部署。
实验结果
研究问题
- RQ1能否设计一种灵活且可重参数化的搜索空间,允许每模块任意分支数量,同时支持高效单路径推理?
- RQ2能否在内存约束下,通过一阶段 NAS 方法有效搜索最优多样化分支模块(ODBBs),而无需微调?
- RQ3在训练过程中对低重要性分支进行动态剪枝,是否能在不降低性能的前提下提升内存效率?
- RQ4所提方法能否在准确率与延迟权衡上超越人工设计模块(如 RepVGG、ACB)及先前的 NAS 模型?
主要发现
- 所搜索的 ODBB-A0 在目标检测上达到 31.4% COCO AP,推理时间仅 0.048s,优于推理速度更快的 ResNet-18(28.1% AP)。
- ODBB-B3 达到 37.3% COCO AP,推理时间 0.148s,比 ResNet-101(34.6% AP)高出 2.7% AP,且延迟相当。
- 仅使用 50 个分支的 ODBB 在 top-1 准确率上优于 RepVGG(66 个分支)、DBB(88 个分支)和 ACB(66 个分支),证明其卓越效率。
- 75 个分支的 ODBB 达到与更大配置相当的性能,表明超过一定分支数量后收益递减。
- 超网络中的权重共享使子网络收敛更快,性能更稳定,相比独立权重更新更具优势。
- 采用 RepNAS 训练的超网络能有效对高性能子网络进行排序,表现为在训练过程中采样子网络的准确率始终更高且更稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。