Skip to main content
QUICK REVIEW

[论文解读] Learning Architectures for Binary Networks

Dahyun Kim, Kunal Pratap Singh|arXiv (Cornell University)|Feb 17, 2020
Advanced Neural Network Applications参考文献 55被引用 5
一句话总结

该论文提出了BNAS,这是首个专为二值神经网络设计的神经架构搜索方法,通过定义一种新型搜索空间(包含对量化鲁棒的层类型)和一种包含Zeroise层的重新设计的单元模板。该方法引入了一种多样性正则化的搜索目标以稳定训练,并发现了在相同FLOP预算下优于当前最先进方法的二值化网络架构,适用于CIFAR-10和ImageNet数据集。

ABSTRACT

Backbone architectures of most binary networks are well-known floating point architectures such as the ResNet family. Questioning that the architectures designed for floating point networks would not be the best for binary networks, we propose to search architectures for binary networks (BNAS) by defining a new search space for binary architectures and a novel search objective. Specifically, based on the cell based search method, we define the new search space of binary layer types, design a new cell template, and rediscover the utility of and propose to use the Zeroise layer instead of using it as a placeholder. The novel search objective diversifies early search to learn better performing binary architectures. We show that our proposed method searches architectures with stable training curves despite the quantization error inherent in binary networks. Quantitative analyses demonstrate that our searched architectures outperform the architectures used in state-of-the-art binary networks and outperform or perform on par with state-of-the-art binary networks that employ various techniques other than architectural changes.

研究动机与目标

  • 为解决现有二值化网络因复用浮点骨干网络架构而导致的性能不佳问题,此类架构对二值权重和激活不友好。
  • 探究在考虑量化误差和梯度不稳定性的前提下,神经架构搜索是否能够发现性能更优的二值化网络架构。
  • 设计一种专为二值化网络构建的搜索空间,排除易受高量化误差影响的层类型(如深度可分离卷积),并引入有益组件如Zeroise层。
  • 开发一种新颖的搜索目标,引入多样性正则化项,以在搜索初期促进多样化探索,从而提升收敛性和性能。
  • 证明神经架构搜索可生成超越当前最先进模型的二值化网络,且无需依赖高级训练技术或二值化方案。

提出的方法

  • 提出一种新的二值化网络搜索空间,因深度可分离卷积存在高量化误差而被排除,并将Zeroise层作为可学习组件纳入其中。
  • 设计一种新型单元模板,引入跨单元跳跃连接,以稳定训练并缓解二值量化带来的梯度问题。
  • 提出一种新颖的搜索目标,引入多样性正则化项,以在早期搜索阶段鼓励探索多样化的层类型。
  • 采用基于单元的可微神经架构搜索框架,其中搜索空间定义在二值化层类型和连接方式之上。
  • 所有实验均采用XNOR-Net二值化方案,以隔离架构搜索本身的影响,排除其他改进因素的干扰。
  • 在CIFAR-10和ImageNet上,于不同FLOP预算下训练并评估所搜索出的架构,以评估其泛化能力和效率。

实验结果

研究问题

  • RQ1是否能通过专为二值化网络设计的搜索空间,获得优于从浮点网络迁移而来的架构?
  • RQ2将Zeroise层作为可学习组件纳入网络,是否比将其视为占位符能显著提升二值化网络性能?
  • RQ3在存在量化误差的情况下,多样性正则化的搜索目标是否能稳定训练并引导发现更优的二值化网络架构?
  • RQ4在相同FLOP约束下,所搜索出的二值化架构是否优于人工设计或当前最先进方法的二值化网络?
  • RQ5仅通过架构改进是否足以使性能超越依赖高级二值化方案或训练技术的方法?

主要发现

  • 所提出的BNAS方法在CIFAR-10上实现了92.70%的测试准确率(约0.27 GFLOPs),优于当前最先进方法BinaryNet(89.95%)和PCNN(仅在未二值化下采样时达94.31%)。
  • BNAS-Mini仅需约0.16 GFLOPs,在CIFAR-10上达到90.12%的准确率,优于除WideResNet40基线外的所有其他二值化网络。
  • 在ImageNet上,BNAS-D在约1.63 GFLOPs下实现57.69%的top-1准确率和79.89%的top-5准确率,优于相同主干网络的BinaryNet(42.20%)和ABC-Net(42.70%)。
  • 消融实验表明,若移除跨单元跳跃连接,训练将发生崩溃;而排除Zeroise层或多样性正则化项则导致准确率显著下降。
  • 多样性正则化项对搜索性能有实质性贡献:完整BNAS模型(含所有组件)在CIFAR-10上达到94.43%准确率(BNAS-C),而无正则化项时仅为92.66%。
  • 结果表明,仅通过架构改进即可实现显著性能提升,BNAS-F在ImageNet上实现58.99%的top-1准确率,虽未超越Bi-Real Net34(62.20%)的top-1准确率,但其FLOP效率更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。