Skip to main content
QUICK REVIEW

[논문 리뷰] Back to Simplicity: How to Train Accurate BNNs from Scratch?

Joseph Bethge, Haojin Yang|arXiv (Cornell University)|2019. 06. 19.
Advanced Neural Network Applications참고 문헌 29인용 수 44
한 줄 요약

이 논문은 단순한 학습 전략과 네트워크 설계로부터 고도로 정확한 이진 신경망을 학습시킬 수 있음을 입증하고, 추가 트릭 없이 ImageNet에서 이전 1비트 CNN을 능가하는 BinaryDenseNet을 도입한다.

ABSTRACT

Binary Neural Networks (BNNs) show promising progress in reducing computational and memory costs but suffer from substantial accuracy degradation compared to their real-valued counterparts on large-scale datasets, e.g., ImageNet. Previous work mainly focused on reducing quantization errors of weights and activations, whereby a series of approximation methods and sophisticated training tricks have been proposed. In this work, we make several observations that challenge conventional wisdom. We revisit some commonly used techniques, such as scaling factors and custom gradients, and show that these methods are not crucial in training well-performing BNNs. On the contrary, we suggest several design principles for BNNs based on the insights learned and demonstrate that highly accurate BNNs can be trained from scratch with a simple training strategy. We propose a new BNN architecture BinaryDenseNet, which significantly surpasses all existing 1-bit CNNs on ImageNet without tricks. In our experiments, BinaryDenseNet achieves 18.6% and 7.6% relative improvement over the well-known XNOR-Network and the current state-of-the-art Bi-Real Net in terms of top-1 accuracy on ImageNet, respectively.

연구 동기 및 목표

  • BNN 학습에 대한 일반적인 상식에 의문을 제기하고, 일반적인 트릭이 필요한지 여부를 검토한다.
  • 이진 네트워크에서 정보 흐름을 보존하는 일반적인 설계 원칙을 식별한다.
  • 새로운 BNN 아키텍처(BinaryDenseNet)를 제안하고 최첨단 정확도를 달성하는지 검증한다.
  • ImageNet와 CIFAR-10에서 처음부터 학습의 효과를 입증하고 재현성을 위한 오픈 소스 코드를 제공한다.

제안 방법

  • 일반적인 BNN 기법들(스케일링 인자, approxsign, 전체 정밀도 사전 학습)을 재검토하고, 처음부터 학습할 때 이들의 영향을 실험적으로 평가한다.
  • 정보 흐름을 극대화하기 위한 지침을 제시하며, 단축 경로 연결을 장려하고 병목을 피한다.
  • DenseNet 개념을 이진 네트워크에 적용하여 BinaryDenseNet을 개발하고 다운샘플링 전략(전체 정밀도 대 이진)을 평가한다.
  • ImageNet에서 기존 1비트 CNN과 비교하고 SSD를 사용한 물체 탐지 예비 연구를 수행한다.
  • 재현성을 위한 BMXNet 기반의 오픈 소스 구현을 제공한다.

실험 결과

연구 질문

  • RQ1표준 학습 전략을 사용하고 스케일링 트릭이나 사전 학습 없이도 고정밀 BNN을 처음부터 학습시킬 수 있는가?
  • RQ2정밀도 손실을 완화하기 위해 이진 네트워크에서 정보 흐름을 가장 잘 보존하는 네트워크 설계 원칙은 무엇인가?
  • RQ3단축 연결을 늘리고 병목을 피하는 것이 대규모 데이터셋에서 BNN에 측정 가능한 이득을 가져오는가?
  • RQ4ImageNet에서 BinaryDenseNet의 성능은 최첨단 1비트 CNN(XNOR-Net, Bi-Real Net 등)에 비해 어떤가?

주요 결과

  • BinaryDenseNet은 ImageNet에서 1비트 CNN 중 최첨단 정확도를 달성하고, 이전 방법들을 상당한 차이로 앞지른다.
  • 제안된 원칙으로 처음부터 학습된 BinaryResNetE18은 동일한 아키텍처를 사용하는 기존의 여러 BNN보다 성능이 우수하고, 스케일링 인자는 필요하지 않다.
  • ImageNet에서 BinaryDenseNet 모델은 BinaryDenseNet28에서 60.7%와 같은 top-1 정확도에 도달하고 더 큰 변형에서 더 높아지는 반면, Bi-Real Net 및 XNOR-Net은 비교적으로 크게 낮다.
  • 전체 정밀도 다운샘플링 계층은 ImageNet에서 정확도를 크게 향상시킬 수 있으며(이진 ResNetE18의 경우 약 3%), 모델 크기가 커지는 대가가 따른다.
  • DenseNet에서 영감을 받은 설계처럼 단축 연결 수를 늘리는 것이 BinaryDenseNet의 정보 흐름과 정확도를 향상시키며, 블록을 분할하고 연결성을 확장할 때 이점이 관찰된다.
  • 제안된 설계 원칙으로 처음부터 학습하는 결과가 기존의 1비트 CNN들을 능가할 수 있음을 보여주며, 스케일링, approxsign, FP 사전 학습과 같은 트릭 없이도 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.