Skip to main content
QUICK REVIEW

[论文解读] Big-Little Net: An Efficient Multi-Scale Feature Representation for Visual and Speech Recognition

Chun-Fu Chen, Quanfu Fan|arXiv (Cornell University)|Jul 10, 2018
Advanced Image and Video Retrieval Techniques参考文献 53被引用 60
一句话总结

Big-Little Net (bL-Net) 使用两分支多尺度架构来融合高分辨率与低分辨率特征,在视觉任务中实现显著的 FLOP 降低与精度提升,并在语音识别中以 30% 的 FLOPs 省力实现更低的词错误率(WER).

ABSTRACT

In this paper, we propose a novel Convolutional Neural Network (CNN) architecture for learning multi-scale feature representations with good tradeoffs between speed and accuracy. This is achieved by using a multi-branch network, which has different computational complexity at different branches. Through frequent merging of features from branches at distinct scales, our model obtains multi-scale features while using less computation. The proposed approach demonstrates improvement of model efficiency and performance on both object recognition and speech recognition tasks,using popular architectures including ResNet and ResNeXt. For object recognition, our approach reduces computation by 33% on object recognition while improving accuracy with 0.9%. Furthermore, our model surpasses state-of-the-art CNN acceleration approaches by a large margin in accuracy and FLOPs reduction. On the task of speech recognition, our proposed multi-scale CNNs save 30% FLOPs with slightly better word error rates, showing good generalization across domains. The codes are available at https://github.com/IBM/BigLittleNet

研究动机与目标

  • 通过在多尺度特征表示中平衡速度与精度,推动 CNN 的高效部署。
  • 提出一个简单、可泛化的多分支架构,将来自不同尺度的特征融合以增强表示。
  • 证明该方法在对象识别上可在减少计算量的同时提升精度,并在语音识别中以更少的 FLOPs 降低 WER。

提出的方法

  • 引入 Big-Little Net (bL-Net),包含高精度高成本的 Big-Branch 与较低成本的 Little-Branch,在不同尺度上运行。
  • 在每个 Big-Little 模块中,通过对变换特征的加权线性组合将 K 个分支(不同尺度)进行融合。
  • 在融合前使用上采样和 1x1 卷积对齐跨分支的特征图。
  • 通过两类因子 alpha(宽度)和 beta(深度)来控制 Little-Branch 的复杂度以减少 FLOPs。
  • 将分支输出在合并后通过残差块 F(·) 进行融合。
  • 证明与 ResNet、ResNeXt、SEResNeXt 等骨干网络的兼容性,在相近或更高的准确度下实现约 2x 的加速。
  • 展示线性融合相较于拼接在对象识别中的优势。

实验结果

研究问题

  • RQ1多尺度、多分支的融合是否能带来比单尺度基线更好的速度-精度权衡?
  • RQ2Big-Branch 与 Little-Branch 如何在不同尺度上交互以在降低计算量的同时保留信息?
  • RQ3Little-Branch 的复杂度参数(alpha、beta)对视觉与语音任务的性能与 FLOPs 的影响是什么?
  • RQ4该方法是否可在不同架构(ResNet、ResNeXt、SEResNeXt)及模态(视觉与语音)上泛化?

主要发现

  • 在 ImageNet 的对象识别中,bL-Net 在多种骨干网络上实现了大约 1/3 的计算量下降并带来超过 1 个百分点的精度提升,甚至在不降低精度的情况下实现多达 1/2 的 FLOPs 减少。
  • 在 ResNet、ResNeXt、SEResNeXt 骨干网络中,bL-Net 以接近 2x 的速度提升实现,同时维持或提高 top-1 精度。
  • 更深的模型从 bL-Net 中获益更多,以基于 resnet-152 的变体为例,速度提升更大(如 2.3x)比较浅的模型。
  • 在较高输入分辨率(如 256x256)下评估时,bL-Net 维持较低的 FLOPs 并在基线基础上实现更高的准确性。
  • 在语音识别中,bL-Net 在大约 30% 的 FLOPs 下降的同时,词错误率(WER)略优于基线,展示跨领域的泛化能力。
  • 分支的线性合并在对象与语音实验中都提供比拼接更好的准确性与正则化效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。