[论文解读] Making EfficientNet More Efficient: Exploring Batch-Independent Normalization, Group Convolutions and Reduced Resolution Training
该论文通过三种技术显著提升了高效网络(EfficientNet)模型在Graphcore IPU加速器上的实际效率:将深度可分离卷积替换为分组卷积,引入代理归一化激活以改善与批次无关的归一化,以及在半分辨率下进行训练并随后微调。这些方法共同将训练吞吐量最高提升至7倍,推理延迟最高降低1.4倍,显著缩小了理论效率与实际性能之间的差距。
Much recent research has been dedicated to improving the efficiency of training and inference for image classification. This effort has commonly focused on explicitly improving theoretical efficiency, often measured as ImageNet validation accuracy per FLOP. These theoretical savings have, however, proven challenging to achieve in practice, particularly on high-performance training accelerators. In this work, we focus on improving the practical efficiency of the state-of-the-art EfficientNet models on a new class of accelerator, the Graphcore IPU. We do this by extending this family of models in the following ways: (i) generalising depthwise convolutions to group convolutions; (ii) adding proxy-normalized activations to match batch normalization performance with batch-independent statistics; (iii) reducing compute by lowering the training resolution and inexpensively fine-tuning at higher resolution. We find that these three methods improve the practical efficiency for both training and inference. Code available at https://github.com/graphcore/graphcore-research/tree/main/Making_EfficientNet_More_Efficient .
研究动机与目标
- 解决高效网络在高性能加速器(如IPU)上理论FLOP效率与实际性能之间的差距。
- 在不牺牲模型准确率的前提下提升训练与推理效率。
- 探索超越基于FLOP理论指标的硬件利用率提升的算法改进方法。
- 证明通过架构和训练策略的修改可实现实际效率的提升。
提出的方法
- 将深度可分离卷积推广为分组卷积,以提升计算效率和硬件利用率。
- 引入代理归一化激活,使其在保持批次无关统计特性的同时达到与批量归一化相当的性能。
- 将训练分辨率降低至原始尺寸的一半,以降低计算成本和数据移动量。
- 在更高分辨率下应用轻量级微调步骤,以恢复低分辨率训练中损失的准确率。
- 采用逐层缩放和权重标准化,以在使用批次无关归一化时稳定训练过程。
- 评估这些方法组合对EfficientNet B0-B5在训练吞吐量、推理延迟和准确率方面的影响。
实验结果
研究问题
- RQ1能否通过用分组卷积替代深度可分离卷积来提升现代加速器上的实际训练效率?
- RQ2代理归一化激活在多大程度上可以弥合批次无关归一化与批量归一化之间的性能差距?
- RQ3在半分辨率下训练并随后微调是否比原分辨率训练带来更好的实际效率?
- RQ4这些改进方法在不同模型规模下如何共同影响训练吞吐量和推理延迟?
- RQ5理论FLOP效率的提升能否有效转化为实际硬件性能的改进?
主要发现
- 分组卷积、代理归一化激活与半分辨率训练的组合使训练吞吐量相比基线EfficientNet最高提升了7倍。
- 使用优化配置后,推理延迟最高降低了1.4倍,尤其在G16-LN+PN-Half设置下表现显著。
- G16-EfficientNet变体的实际吞吐量显著优于G1-EfficientNet变体,证明了更大分组尺寸的优势。
- 半分辨率训练在理论效率上使实际吞吐量提升了2倍,即使在全分辨率下测试时仍获得显著收益。
- LN+PN配置的准确率高于GN基线模型,但吞吐量损失约10%,表明进一步的软件优化可缩小这一差距。
- 最高效的配置(G16-LN+PN-Half)实现了最高3.6倍的推理吞吐量提升,并在所有测试分辨率下保持了高准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。