[논문 리뷰] Performance Guaranteed Network Acceleration via High-Order Residual Quantization
이 논문은 깊이 있는 신경망에서 양자화 오차를 줄이기 위해 잔차 오차에 대해 반복적으로 임계값을 적용하는 새로운 이진 근사 방법인 고차 잔차 양자화(HORQ)를 제안한다. 감쇠하는 크기 척도에서 다수의 이진 특징 맵을 생성하고 고차 이진 필터링을 사용함으로써 HORQ는 정확도 손실이 최소화된 채로 최대 30배의 속도 향상을 달성하며, CIFAR-10에서 XNOR-Net보다 약 3% 높은 성능을, MNIST에서는 0.71% 높은 성능을 보이며 32배의 모델 압축을 유지한다.
Input binarization has shown to be an effective way for network acceleration. However, previous binarization scheme could be regarded as simple pixel-wise thresholding operations (i.e., order-one approximation) and suffers a big accuracy loss. In this paper, we propose a highorder binarization scheme, which achieves more accurate approximation while still possesses the advantage of binary operation. In particular, the proposed scheme recursively performs residual quantization and yields a series of binary input images with decreasing magnitude scales. Accordingly, we propose high-order binary filtering and gradient propagation operations for both forward and backward computations. Theoretical analysis shows approximation error guarantee property of proposed method. Extensive experimental results demonstrate that the proposed scheme yields great recognition accuracy while being accelerated.
연구 동기 및 목표
- 깊이 있는 신경망에서 일차 이진화에 의해 발생하는 심각한 정확도 저하 문제를 해결하기 위해.
- 높은 근사 정확도를 유지하면서도 효율적인 이진 연산을 가능하게 하는 이진 양자화 체계를 개발하기 위해.
- 제안된 양자화 프레임워크에 대한 이론적 오차 보장을 제공하기 위해.
- CPU에서 실용적인 구현을 가능하게 하며 성능 손실를 최소화하는 깊이 신경망의 배포를 가능하게 하기 위해.
제안 방법
- 고차 잔차 양자화(HORQ)를 제안하며, 감쇠하는 크기 척도에서 다수의 이진 특징 맵을 생성하기 위해 잔차 오차에 대해 반복적으로 임계값을 적용한다.
- 전방 및 후행 계산을 위해 오직 이진 연산만을 사용하는 고차 이진 필터링 및 기울기 전파 연산을 도입한다.
- 반복적인 잔차 분해를 활용하며, K차 수준에서 입력은 K개의 이진 맵과 잔차의 합으로 근사되며, 각 단계에서 근사가 정밀해진다.
- 근사 오차에 대한 이론적 경계를 유도하며, 양자화 순서가 증가할수록 오차 감소가 보장됨을 보여준다.
- 이진 가중치와 이진 활성 맵을 사용하여 32배의 모델 압축을 달성하며, 현대 CPU에서 사이클당 오직 64비트 이진 연산만을 사용해 계산을 수행한다.
- 표준 합성곱 레이어에 이 방법을 적용하며, 최종 출력은 각 잔차 단계의 출력 합으로 구성된다.
실험 결과
연구 질문
- RQ1반복적인 잔차 양자화가 일차 임계값 적용을 초월해 이진 신경망의 근사 오차를 줄일 수 있는가?
- RQ2고차 이진 연산이 추론 시 상당한 속도 향상을 이끌어내면서도 높은 정확도를 유지할 수 있는가?
- RQ3제안된 고차 잔차 양자화 체계의 이론적 오차 경계는 무엇인가?
- RQ4필터 크기, 채널 수, 양자화 순서와 함께 속도 향상 비율은 어떻게 변화하는가?
- RQ5HORQ는 XNOR-Net과 같은 기존 이진화 방법보다 정확도와 효율성 측면에서 뛰어나게 성능을 냈는가?
주요 결과
- HORQ-Net은 평균적으로 30배의 속도 향상을 달성하였으며, 최적 조건(64×256 채널, 3×3 필터)에서 31.98배의 속도 향상을 기록하였다.
- 이 방법은 이론적 오차 보장을 제공하며, 양자화 순서가 증가할수록 근사 오차가 감소함을 보여주었다.
- CIFAR-10에서 HORQ-Net은 XNOR-Net보다 상위 1위 정확도에서 약 3% 높은 성능을 기록하였다.
- MNIST에서 HORQ-Net은 XNOR-Net보다 0.71% 높은 정확도를 달성하였다.
- 이진 가중치를 사용하여 약 32배의 압축 비율을 달성하였으며, 저장 요구량을 크게 줄였다.
- 2차 및 3차 양자화에서도 속도 향상 비율이 20배를 초과하여 실용적인 실세계 구현에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.