Skip to main content
QUICK REVIEW

[논문 리뷰] Build a Compact Binary Neural Network through Bit-level Sensitivity and Data Pruning

Yixing Li, Fengbo Ren|arXiv (Cornell University)|2018. 02. 03.
Advanced Neural Network Applications참고 문헌 14인용 수 5
한 줄 요약

이 논문은 모델 크기와 추론 지연을 줄이기 위해 비트 수준 민감도 분석과 데이터 프루닝을 적용하여 컴act Binarized Neural Networks (CBNNs)를 제안한다. 입력 데이터의 부서진 비트 슬라이스를 식별하고 민감도가 낮은 비트를 프루닝함으로써, 최대 3.9배 작아진 네트워크 크기와 ≤1%의 정확도 손실을 달성하며, 기준 BNN 대비 2배, 정밀도가 전체인 모델 대비 9.9배 빠른 런타임을 확보한다.

ABSTRACT

Convolutional neural network (CNN) has been widely used for vision-based tasks. Due to the high computational complexity and memory storage requirement, it is hard to directly deploy a full-precision CNN on embedded devices. The hardware-friendly designs are needed for re-source-limited and energy-constrained embed-ded devices. Emerging solutions are adopted for the neural network compression, e.g., bina-ry/ternary weight network, pruned network and quantized network. Among them, Binarized Neural Network (BNN) is believed to be the most hardware-friendly framework due to its small network size and low computational com-plexity. No existing work has further shrunk the size of BNN. In this work, we explore the redun-dancy in BNN and build a compact BNN (CBNN) based on the bit-level sensitivity analy-sis and bit-level data pruning. The input data is converted to a high dimensional bit-sliced for-mat. In post-training stage, we analyze the im-pact of different bit slices to the accuracy. By pruning the redundant input bit slices and shrinking the network size, we are able to build a more compact BNN. Our result shows that we can further scale down the network size of the BNN up to 3.9x with no more than 1% accuracy drop. The actual runtime can be reduced up to 2x and 9.9x compared with the baseline BNN and its full-precision counterpart, respectively.

연구 동기 및 목표

  • 자원이 제한된 임베디드 장치에 큰 신경망을 구현하는 데 도전하는 문제를 해결하기 위해.
  • 이미 하드웨어 우수성을 지닌 Binarized Neural Networks (BNNs)의 크기와 계산 비용을 줄이기 위해.
  • BNN 내의 부재성 요소를 비트 수준에서 탐색하고 이를 추가 압축에 활용하기 위해.
  • 학습 후 프루닝을 통해 모델 크기와 추론 시간을 극적으로 줄이면서도 높은 정확도를 유지하기 위해.

제안 방법

  • 각 비트 슬라이스의 분석을 가능하게 하기 위해 입력 데이터를 고차원 비트 슬라이스 형식으로 변환한다.
  • 각 비트 슬라이스가 네트워크 정확도에 기여하는 정도를 평가하기 위해 비트 수준 민감도 분석을 수행한다.
  • 민감도 점수에 기반해 부과성 비트 슬라이스를 프루닝하여 입력 차원을 감소시킨다.
  • 비중이 낮은 비트를 식별한 후 네트워크 프루닝을 적용해 BNN 아키텍처를 축소한다.
  • 정확도를 유지하면서 모델 크기를 최소화하기 위해 학습 후 양자화 및 프루닝을 적용한다.
  • 비트 수준과 데이터 수준의 프루닝 전략을 통합하여 최종 네트워크를 추론에 최적화한다.

실험 결과

연구 질문

  • RQ1입력 데이터의 비트 수준 표현에서 부과성 요소를 식별하고 제거할 수 있는가, 이로 인해 정확도 손실이 크지 않은가?
  • RQ2개별 비트 슬라이스를 프루닝하면 Binarized Neural Network의 성능에 어떤 영향을 미치는가?
  • RQ3비트 수준 민감도 분석과 데이터 프루닝을 통해 BNN은 어느 정도까지 압축될 수 있는가?
  • RQ4컴팩트 BNN에서 모델 크기 축소와 정확도 저하 사이의 상충 관계는 어떠한가?
  • RQ5결과로 도출된 컴팩트 BNN은 임베디드 장치에서 추론 시간을 크게 단축시킬 수 있는가?

주요 결과

  • 제안된 방법은 BNN의 네트워크 크기를 최대 3.9배 줄였으며, 정확도 손실은 1% 이내로 유지된다.
  • 기준 BNN 대비 런타임은 최대 2배 감소하고, 정밀도가 전체인 모델 대비 9.9배 빨라진다.
  • 비트 수준 민감도 분석은 입력 데이터의 부과성 비트 슬라이스를 성공적으로 식별하여 효과적인 프루닝을 가능하게 한다.
  • 컴팩트 BNN은 상당한 압축과 속도 향상을 달성하면서도 높은 정확도를 유지한다.
  • 이 방법은 기존 BNN 프레임워크를 초월해 추가적인 모델 압축을 가능하게 하여 하드웨어 우수성을 지닌 신경망의 한계를 극복한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.