Skip to main content
QUICK REVIEW

[논문 리뷰] AdaBin: Improving Binary Neural Networks with Adaptive Binary Sets

Zhijun Tu, Xinghao Chen|arXiv (Cornell University)|2022. 08. 17.
Advanced Neural Network Applications인용 수 4
한 줄 요약

AdaBin은 이진 신경망(BNNs)을 위한 새로운 적응형 이진 양자화 방법을 제안하며, 고정된 \{-1, +1\} 대신 가중치와 활성화에 대해 최적의 실수 이진 집합 \{b₁, b₂\}을 학습한다. 가중치에는 통계적 균형화를, 활성화에는 기울기 기반 최적화를 적용한다. 이 방법은 최신 기술 수준의 성능을 달성하여 ResNet-18을 사용해 ImageNet에서 66.4%의 Top-1 정확도를 기록하고, SSD300을 사용해 PASCAL VOC에서 69.4 mAP를 달성한다.

ABSTRACT

This paper studies the Binary Neural Networks (BNNs) in which weights and activations are both binarized into 1-bit values, thus greatly reducing the memory usage and computational complexity. Since the modern deep neural networks are of sophisticated design with complex architecture for the accuracy reason, the diversity on distributions of weights and activations is very high. Therefore, the conventional sign function cannot be well used for effectively binarizing full-precision values in BNNs. To this end, we present a simple yet effective approach called AdaBin to adaptively obtain the optimal binary sets $\{b_1, b_2\}$ ($b_1, b_2\in \mathbb{R}$) of weights and activations for each layer instead of a fixed set ( extit{i.e.}, $\{-1, +1\}$). In this way, the proposed method can better fit different distributions and increase the representation ability of binarized features. In practice, we use the center position and distance of 1-bit values to define a new binary quantization function. For the weights, we propose an equalization method to align the symmetrical center of binary distribution to real-valued distribution, and minimize the Kullback-Leibler divergence of them. Meanwhile, we introduce a gradient-based optimization method to get these two parameters for activations, which are jointly trained in an end-to-end manner. Experimental results on benchmark models and datasets demonstrate that the proposed AdaBin is able to achieve state-of-the-art performance. For instance, we obtain a 66.4% Top-1 accuracy on the ImageNet using ResNet-18 architecture, and a 69.4 mAP on PASCAL VOC using SSD300. The PyTorch code is available at \url{https://github.com/huawei-noah/Efficient-Computing/tree/master/BinaryNetworks/AdaBin} and the MindSpore code is available at \url{https://gitee.com/mindspore/models/tree/master/research/cv/AdaBin}.

연구 동기 및 목표

  • 고정된 이진 집합 \{-1, +1\}이 다양한 가중치 및 활성화 분포와 잘 맞지 않아 발생하는 BNN의 심각한 정확도 저하 문제를 해결한다.
  • 복잡하고 비대칭적인 분포를 가진 레이어에서 기울기 함수의 한계를 극복하여 특징을 이진화하는 데 어려움을 해결한다.
  • 더 나은 정밀도 분포를 반영하는 최적의 실수 이진 집합 \{b₁, b₂\}을 학습함으로써 BNN의 표현 능력을 향상시킨다.
  • XNOR 및 BitCount 연산을 통해 하드웨어 효율성을 유지하면서도, 가중치와 활성화에 대해 적응형 이진 집합을 엔드 투 엔드로 훈련할 수 있도록 한다.
  • 객체 검출 및 세그멘테이션과 같은 복잡한 비전 작업에서 BNN과 정밀도가 높은 네트워크 간의 성능 격차를 해소한다.

제안 방법

  • 1비트 값의 중심 위치와 거리 기반으로 새로운 이진 양자화 함수를 정의하여 고정된 부호 함수를 대체한다.
  • 가중치의 경우, 이진 분포의 대칭 중심을 실수 분포에 맞추고 Kullback-Leibler 발산(KLD)을 최소화함으로써 중심과 거리에 대한 해석적 해를 유도하는 균형화 방법을 적용한다.
  • 활성화의 경우, 중심과 거리를 학습 가능한 파라미터로 두고 기울기 기반 최적화 방법을 도입하며, 부호 함수로 초기화하고 엔드 투 엔드로 공동 훈련한다.
  • 학습 가능한 스케일 인자 \gamma⁺ 및 \gamma⁻를 가진 Maxout 유사 비선형성 도입으로, 비트 폭을 늘리지 않고도 활성화 표현을 향상시킨다.
  • 최종 이진 연산이 여전히 XNOR 및 BitCount를 유지하도록 하여 약 64배의 속도 향상과 약 32배의 메모리 절감을 확보한다.
  • 학습된 이진 집합이 원래 정밀도 텐서의 통계적 성질을 유지하도록 KLD 최소화와 통계적 정렬을 활용한다.

실험 결과

연구 질문

  • RQ1고정된 \{-1, +1\} 대신 적응형 이진 집합 \{b₁, b₂\}을 학습함으로써 BNN의 표현 능력을 향상시킬 수 있는가?
  • RQ2가중치와 활성화에 대해 중심과 거리의 적응형 학습이 ImageNet 및 PASCAL VOC와 같은 복잡한 데이터셋에서 BNN의 성능에 미치는 영향은 어떠한가?
  • RQ3AdaBin은 객체 검출 및 분류 작업에서 BNN과 정밀도가 높은 모델 간의 정확도 격차를 어느 정도 해소할 수 있는가?
  • RQ4가중치에 대해 KLD 최소화와 균형화를, 활성화에 대해 기울기 기반 최적화를 조합함으로써 다양한 네트워크 아키텍처에서 일관된 성능 향상이 이루어지는가?
  • RQ5제안된 방법은 기존 BNN보다 정확도를 크게 향상시키면서도 하드웨어 효율성(XNOR 및 BitCount)을 유지할 수 있는가?

주요 결과

  • AdaBin은 ResNet-18을 사용해 ImageNet에서 66.4%의 Top-1 정확도를 기록하며, 이전 최신 기술 수준의 BNN보다 유의미한 성능 향상을 달성한다.
  • SSD300을 사용한 PASCAL VOC에서 AdaBin은 69.4 mAP를 달성하여 XNOR-Net보다 13.8 mAP, Bi-Real Net보다 5.6 mAP 높은 성능을 기록한다.
  • 제거 분석 결과, AdaBin의 가중치 균형화와 활성화 최적화를 조합하면 CIFAR-10에서 기존 BNN보다 정확도가 2% 향상된다.
  • 학습 가능한 \gamma⁺ 및 \gamma⁻를 가진 Maxout 활성화는 각각 9.6%와 9.7%의 정확도 향상을 기록하며, 두 계수를 동시에 사용할 경우 가장 우수한 성능(88.2% 정확도)을 기록한다.
  • 단서 구조를 사용한 AdaBin은 TWN 및 DoReFa와 같은 4비트 양자화 방법을 능가하며, 적응형 이진화가 다중 비트 기반 모델을 초월할 수 있음을 보여준다.
  • 이론적 가속도 60.85배와 메모리 절감 31배를 유지함으로써, 효율적인 하드웨어 배포와의 호환성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.