Skip to main content
QUICK REVIEW

[논문 리뷰] Big-Little Net: An Efficient Multi-Scale Feature Representation for Visual and Speech Recognition

Chun-Fu Chen, Quanfu Fan|arXiv (Cornell University)|2018. 07. 10.
Advanced Image and Video Retrieval Techniques참고 문헌 53인용 수 60
한 줄 요약

Big-Little Net (bL-Net)은 고해상도와 저해상도 피처를 융합하기 위해 두 가지 분기 멀티-스케일 구조를 사용하여 시각 작업에서 정확도 향상을 달성하고, 음성 인식에서 30% FLOPs 절감으로 WER를 개선하는 등 substantial FLOP 감소를 이끕니다.

ABSTRACT

In this paper, we propose a novel Convolutional Neural Network (CNN) architecture for learning multi-scale feature representations with good tradeoffs between speed and accuracy. This is achieved by using a multi-branch network, which has different computational complexity at different branches. Through frequent merging of features from branches at distinct scales, our model obtains multi-scale features while using less computation. The proposed approach demonstrates improvement of model efficiency and performance on both object recognition and speech recognition tasks,using popular architectures including ResNet and ResNeXt. For object recognition, our approach reduces computation by 33% on object recognition while improving accuracy with 0.9%. Furthermore, our model surpasses state-of-the-art CNN acceleration approaches by a large margin in accuracy and FLOPs reduction. On the task of speech recognition, our proposed multi-scale CNNs save 30% FLOPs with slightly better word error rates, showing good generalization across domains. The codes are available at https://github.com/IBM/BigLittleNet

연구 동기 및 목표

  • CNN의 배치를 통해 다중 스케일 특징 표현에서 속도와 정확도 간의 균형을 맞추는 효율적 배치를 촉진한다.
  • 다양한 스케일에서 특징을 융합하는 간단하고 일반화 가능한 다분기 아키텍처를 제안하여 표현력을 강화한다.
  • 이 접근 방식이 객체 인식에서 계산량을 줄이면서 정확도를 향상시키고, 음성 인식에서 더 적은 FLOPs로 WER을 낮추는 것을 보여준다.

제안 방법

  • Big-Little Net (bL-Net)을 도입하는데, 이는 서로 다른 스케일에서 작동하는 높은 정확도와 높은 비용의 Big-Branch와 낮은 비용의 Little-Branch로 구성된다.
  • 각 Big-Little 모듈 내에서 변환된 피처의 가중 선형 결합으로 K개 분기를 융합한다.
  • 융합 전 피처 맵을 업샘플링 및 1x1 컨볼루션으로 정렬한다.
  • Little-Branch의 복잡도는 두 가지 요소인 alpha(너비)와 beta(깊이)로 제어하여 FLOPs를 감소시킨다.
  • 융합 후 잔차 블록(F(·))으로 분기 출력을 융합한다.
  • ResNet, ResNeXt, SEResNeXt와 같은 백본 아키텍처와의 호환성을 보여 유사하거나 더 나은 정확도에서 약 2배의 속도향상을 달성한다.
  • 선형 결합 융합이 물체 인식에서의 연결(concatenation)보다 우수한 정확도와 규제 효과를 제공함을 보인다.

실험 결과

연구 질문

  • RQ1다중 스케일, 다분기 융합이 단일 스케일 baselines보다 더 나은 속도-정확도 트레이드오프를 제공할 수 있는가?
  • RQ2Big-Branch와 Little-Branch가 서로 다른 스케일에서 정보를 보존하면서 계산을 어떻게 줄이는가?
  • RQ3Little-Branch의 복잡도 매개변수(alpha, beta)가 시각 및 음성 작업에서 성능과 FLOPs에 어떤 영향을 미치는가?
  • RQ4이 접근법이 아키텍처(ResNet, ResNeXt, SEResNeXt) 및 모달리티(시각 및 음성) 전반에 일반화되는가?

주요 결과

  • ImageNet 객체 인식에서, bL-Net은 여러 백본에서 약 1/3 수준의 계산량 감소와 함께 정확도 향상을 달성하며, 정확도 손실 없이 최대 1/2 FLOPs 감소의 이점을 보일 수 있다.
  • ResNet, ResNeXt 및 SEResNeXt 백본에서, bL-Net은 약 2배의 속도 향상을 달성하는 동안 베이스라인 대비 top-1 정확도를 유지하거나 개선한다.
  • 더 깊은 모델에서 bL-Net의 이점이 더 크며, resnet-152 기반 변형은 얕은 모델보다 더 큰 속도 향상(예: 2.3배)을 보인다.
  • 입력 해상도가 더 높은 경우(예: 256x256)에도 bL-Net은 FLOPs를 더 적게 사용하고 베이스라인보다 향상된 정확도를 제공한다.
  • 음성 인식에서, bL-Net은 대략 30%의 FLOPs를 감소시키면서 베이스라인보다 WER이 약간 더 나은 성능을 보여 도메인 간 일반화를 시사한다.
  • 분기 간 선형 융합은 물체 인식 및 음성 실험에서 연결(concatenation)보다 더 나은 정확도와 일반화를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.