[论文解读] High-Capacity Expert Binary Networks
本文提出了一种名为高容量专家二值网络的新框架,通过三项关键技术实现对二值神经网络的性能提升:专家二值卷积,实现基于输入的动态滤波器选择;一种高效的宽度扩展机制,在不增加计算量的前提下提升表示能力;以及一种系统化的最优二值网络架构搜索方法。该方法在 ImageNet 上实现了 71% 的 top-1 准确率,较之前工作高出 6%,且未增加计算成本。
Network binarization is a promising hardware-aware direction for creating efficient deep models. Despite its memory and computational advantages, reducing the accuracy gap between binary models and their real-valued counterparts remains an unsolved challenging research problem. To this end, we make the following 3 contributions: (a) To increase model capacity, we propose Expert Binary Convolution, which, for the first time, tailors conditional computing to binary networks by learning to select one data-specific expert binary filter at a time conditioned on input features. (b) To increase representation capacity, we propose to address the inherent information bottleneck in binary networks by introducing an efficient width expansion mechanism which keeps the binary operations within the same budget. (c) To improve network design, we propose a principled binary network growth mechanism that unveils a set of network topologies of favorable properties. Overall, our method improves upon prior work, with no increase in computational cost, by $\sim6 \%$, reaching a groundbreaking $\sim 71\%$ on ImageNet classification. Code will be made available $\href{https://www.adrianbulat.com/binary-networks}{here}$.
研究动机与目标
- 解决二值神经网络与全精度模型之间长期存在的准确率差距,该差距限制了其在实际场景中的部署,尽管其具备硬件效率优势。
- 克服因将激活值和权重限制在 ±1 而导致的二值网络固有信息瓶颈。
- 在不增加计算复杂度的前提下提升模型容量与表示能力,从而实现在资源受限设备上的实用化部署。
- 提出一种系统化的二值网络架构搜索方法,以识别具有更优性能特性的网络拓扑结构。
- 在保持与先前方法相同计算预算的前提下,实现二值 ImageNet 分类的最先进准确率。
提出的方法
- 提出专家二值卷积,一种条件计算机制,每层学习 N 个二值滤波器专家,并通过轻量级门控网络根据输入特征动态选择每个输入样本对应的单一专家。
- 引入一种宽度扩展机制,通过增加通道数来提升二值网络的有效宽度,同时通过高效的位级操作保持原始计算预算不变。
- 设计一种受 Tan & Le (2019) 启发但专为二值网络定制的二值网络搜索框架,以在固定计算约束下发现最大化准确率的最优架构配置。
- 集成 PReLU 激活函数、跳跃连接、两阶段训练以及从全精度教师模型进行的端到端二值知识蒸馏等成熟技术,以增强训练稳定性并提升泛化能力。
- 采用混合网络结构,仅保留第一层和最后一层、批归一化层以及缩放因子为全精度,其余所有卷积层均被二值化,以维持高效性。
- 应用数据驱动的通道重标定与基于全精度教师模型的知识蒸馏,进一步缩小准确率差距,结果中标记有星号。
实验结果
研究问题
- RQ1条件计算能否有效应用于二值神经网络,通过基于输入的专家选择机制提升模型容量?
- RQ2在不增加计算量的前提下,通过增加二值网络的有效宽度(如通道数)是否能显著提升表示能力和准确率?
- RQ3能否通过系统化策略识别出在相同计算预算下优于现有设计的二值网络架构?
- RQ4知识蒸馏以及架构改进(如跳跃连接和 PReLUs)在多大程度上能缩小二值模型与全精度模型之间的准确率差距?
- RQ5是否可能在不增加 FLOPs 或模型大小的前提下,实现二值网络在 ImageNet 上的最先进准确率?
主要发现
- 所提方法在 ImageNet 上实现了 71% 的 top-1 准确率,相比 Martinez 等人 (2020) 的先前最先进方法(约 65%)提升了约 6%。
- 专家二值卷积实现了动态的、基于输入的滤波器选择,使每个输入可由专用的二值滤波器处理,从而提升泛化能力与模型容量。
- 宽度扩展机制通过增加通道数提升有效容量,同时保持相同计算预算,带来了可测量的准确率增益。
- 两阶段训练、PReLU 激活函数、跳跃连接与知识蒸馏的结合显著提升了训练稳定性与最终性能。
- 最佳二值模型与全精度教师模型之间的准确率差距已缩小至约 3.5–4%,相较先前最先进方法的约 5%,表明知识蒸馏与模型对齐效果更优。
- 该方法具有良好的泛化能力:该架构不仅在二值设置下表现优异,在全精度设置下也表现良好,表明易于二值化的模型本身也具备良好的结构特性,适合全精度训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。