[论文解读] DeepReDuce: ReLU Reduction for Fast Private Inference
DeepReDuce 提出了一种新颖的 ReLU 丢弃技术,通过选择性地从神经网络中移除 ReLU 单元,显著降低私有推理延迟,同时保持模型准确率。通过识别并移除不那么关键的 ReLU 单元,并结合知识蒸馏,DeepReDuce 在保持相同准确率的情况下将 ReLU 数量减少了 3.5 倍,且在相同 ReLU 数量下准确率最高提升 3.5%,在 CIFAR-100 和 TinyImageNet 上优于当前最先进方法。
The recent rise of privacy concerns has led researchers to devise methods for private neural inference -- where inferences are made directly on encrypted data, never seeing inputs. The primary challenge facing private inference is that computing on encrypted data levies an impractically-high latency penalty, stemming mostly from non-linear operators like ReLU. Enabling practical and private inference requires new optimization methods that minimize network ReLU counts while preserving accuracy. This paper proposes DeepReDuce: a set of optimizations for the judicious removal of ReLUs to reduce private inference latency. The key insight is that not all ReLUs contribute equally to accuracy. We leverage this insight to drop, or remove, ReLUs from classic networks to significantly reduce inference latency and maintain high accuracy. Given a target network, DeepReDuce outputs a Pareto frontier of networks that tradeoff the number of ReLUs and accuracy. Compared to the state-of-the-art for private inference DeepReDuce improves accuracy and reduces ReLU count by up to 3.5% (iso-ReLU count) and 3.5$ imes$ (iso-accuracy), respectively.
研究动机与目标
- 为解决加密计算中昂贵的 ReLU 操作导致的私有推理高延迟问题。
- 在不显著降低模型准确率的前提下,减少神经网络中的 ReLU 单元数量。
- 开发一种系统化的方法,用于识别并移除非关键 ReLU 单元,以优化私有推理性能。
- 证明 ReLU 丢弃在私有推理场景中优于传统的剪枝和网络深度缩减方法。
- 生成一个模型的帕累托前沿,以在 ReLU 数量与准确率之间进行权衡,适用于实际部署。
提出的方法
- 提出 ReLU 丢弃作为一种新型优化策略,根据其对模型准确率的贡献程度,移除整个 ReLU 层。
- 使用一种关键性度量指标,按其对网络性能的重要性对 ReLU 单元进行排序,从而实现选择性移除。
- 将 ReLU 丢弃与知识蒸馏相结合,以在剪枝后模型中保持准确率。
- 在移除 ReLU 后,将相邻的线性层进行合并,以进一步降低 FLOPs 和模型深度。
- 通过调整 ReLU 预算并报告准确率权衡,生成一系列优化后的模型帕累托前沿。
- 在多种架构(包括 ResNet、MobileNetV1 和 VGG16)上应用该方法,证明其泛化能力。
实验结果
研究问题
- RQ1ReLU 丢弃是否能在保持高准确率的前提下,显著减少神经网络中的 ReLU 数量,以适用于私有推理?
- RQ2与通道剪枝和网络蒸馏等现有方法相比,ReLU 丢弃在 ReLU 减少效率和准确率保持方面表现如何?
- RQ3ReLU 丢弃是否能有效应用于非残差结构的网络,如 MobileNetV1 和 VGG16?
- RQ4将 ReLU 丢弃与知识蒸馏结合使用,对模型准确率和效率有何影响?
- RQ5DeepReDuce 是否能够生成一个帕累托最优的模型前沿,以在不同网络架构中平衡 ReLU 数量与准确率?
主要发现
- 在 CIFAR-100 上,DeepReDuce 在相同 ReLU 数量下,准确率比当前最先进方法最高提升 3.5%。
- 在相同准确率水平下,与最先进方法相比,DeepReDuce 将 ReLU 数量减少了最多 3.5 倍。
- 在 CIFAR-100 上,最快的 DeepReDuce 模型在仅 455ms 的推理延迟下实现了 65% 的 top-1 准确率。
- 在 TinyImageNet 上,DeepReDuce 实现了 59.18% 的 top-1 准确率,推理时间仅为 4.6 秒,证明其在更大数据集上的可扩展性。
- 该方法优于通道剪枝和网络蒸馏技术,ReLU 减少效率高出 2 倍。
- DeepReDuce 不仅适用于残差网络,还具有良好的泛化能力,在 MobileNetV1 上实现了相同 ReLU 数量下 10.9% 的准确率提升,以及相同准确率下 3.8 倍的 ReLU 数量减少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。