Skip to main content
QUICK REVIEW

[논문 리뷰] Network Quantization with Element-wise Gradient Scaling

Junghyup Lee, Dohyung Kim|arXiv (Cornell University)|2021. 04. 02.
Advanced Neural Network Applications참고 문헌 44인용 수 8
한 줄 요약

이 논문은 연속 입력과 이산 출력 간의 양자화 오차 및 각 기울기의 부호를 고려하여 백프로파게이션 중 기울기를 적응적으로 스케일링하는 새로운 방법인 원소별 기울기 스케일링(EWGS)을 제안한다. EWGS는 표준 직선 추정기(STE)에 비해 학습 안정성과 정확도를 향상시키며, 추가적인 하이퍼파rameter 튜닝이나 학습 스케줄링 없이 CIFAR-10 및 ImageNet에서 다양한 아키텍처와 비트 폭에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Network quantization aims at reducing bit-widths of weights and/or activations, particularly important for implementing deep neural networks with limited hardware resources. Most methods use the straight-through estimator (STE) to train quantized networks, which avoids a zero-gradient problem by replacing a derivative of a discretizer (i.e., a round function) with that of an identity function. Although quantized networks exploiting the STE have shown decent performance, the STE is sub-optimal in that it simply propagates the same gradient without considering discretization errors between inputs and outputs of the discretizer. In this paper, we propose an element-wise gradient scaling (EWGS), a simple yet effective alternative to the STE, training a quantized network better than the STE in terms of stability and accuracy. Given a gradient of the discretizer output, EWGS adaptively scales up or down each gradient element, and uses the scaled gradient as the one for the discretizer input to train quantized networks via backpropagation. The scaling is performed depending on both the sign of each gradient element and an error between the continuous input and discrete output of the discretizer. We adjust a scaling factor adaptively using Hessian information of a network. We show extensive experimental results on the image classification datasets, including CIFAR-10 and ImageNet, with diverse network architectures under a wide range of bit-width settings, demonstrating the effectiveness of our method.

연구 동기 및 목표

  • 직선 추정기(STE)가 모든 기울기를 동일하게 취급하여 이산화 오차를 고려하지 않기 때문에 발생하는 양자화된 신경망에서의 최적화되지 않은 기울기 흐름을 해결하기 위해.
  • 더 적응적인 기울기 갱신 메커니즘을 도입하여 저비트 네트워크 양자화에서의 학습 안정성과 정확도를 향상시키기 위해.
  • 이차 정보를 사용해 각 레이어마다 동적으로 기울기 스케일링을 조정하는 방법을 개발하여 광범위한 하이퍼파rameter 검색이 필요 없도록 하기 위해.
  • 제안된 방법이 다양한 네트워크 아키텍처와 비트 폭 설정 간에 일반화되고 효과적인지 입증하기 위해.

제안 방법

  • EWGS는 백프로파게이션 중 각 기울기 원소를 기울기의 부호와 양자화기의 연속 잠재 입력과 이산 출력 사이의 이산화 오차를 기반으로 적응적으로 스케일링한다.
  • 손실 함수에 대한 이산 출력에 대한 헤시안 행렬의 트레이스를 이용한 스케일링 인자를 허치슨 방법을 통해 효율적으로 추정한다.
  • 각 레이어마다 양자화기의 민감도가 서로 다를 수 있으므로, 스케일링 인자를 레이어별로 적응적으로 갱신한다.
  • 기존의 고정된 기울기 흐름을 갖는 표준 STE를 대체하여, 이산화 과정의 국소 곡률과 오차 민감도를 반영한 기울기 스케일링 메커니즘을 도입한다.
  • 아키텍처 변경이나 추가 학습 스케줄링 없이 기존의 양자화 프레임워크에 통합할 수 있다.
  • 기울기 스케일링을 원소별로 적용하여 이산 양자화 수준 주변의 손실 곡면의 국소 기하학적 특성에 세밀하게 적응할 수 있다.

실험 결과

연구 질문

  • RQ1이산화 오차를 고려한 기울기 스케일링이 표준 STE에 비해 양자화된 신경망에서 학습 안정성과 정확도를 향상시키는가?
  • RQ2헤시안 정보 기반의 적응적 기울기 스케일링은 저비트 네트워크 양자화에서 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ3EWGS는 하이퍼파rameter 재튜닝 없이 다양한 네트워크 아키텍처와 비트 폭 설정 간에 일반화되는가?
  • RQ4특히 1비트와 같은 극단적인 비트 폭 환경에서 EWGS는 기존의 STE를 사용하는 양자화 방법을 능가하는가?
  • RQ5고정된 스케일링 인자와 적응적 스케일링 인자 간의 영향은 양자화된 네트워크의 최종 모델 정확도에 어떤가?

주요 결과

  • EWGS는 ResNet-18, MobileNet-V2, ResNet-20 등의 다양한 네트워크 아키텍처에서 ImageNet과 CIFAR-10에서 다양한 비트 폭에서 STE보다 1%의 정확도 향상을 달성한다.
  • ResNet-20을 사용한 CIFAR-10에서 EWGS는 1비트 가중치와 활성화를 갖는 경우 85.6%의 Top-1 정확도를 기록했으며, 이는 STE(84.7%)를 초월하고 최고의 보고된 결과(85.3%)와 맞먹는다.
  • ImageNet에서 가중치만 이진화된 ResNet-18에 대해 EWGS는 67.3%의 Top-1 정확도를 달성했으며, 이는 STE의 66.3%보다 높아 안정성과 수렴성 향상을 입증한다.
  • EWGS는 STE 및 PROFIT, DoReFa-Net과 같은 다른 기초 양자화 방법보다 일관되게 뛰어난 성능을 보이며, 다양한 프레임워크 간 강력한 일반화 능력을 보여준다.
  • 고정된 스케일링 인자 0.01를 사용할 경우 EWGS는 최적 튜닝 결과와 유사한 성능을 기록하여 광범위한 하이퍼파rameter 튜닝 없이도 강건함을 입증한다.
  • 학습 곡선 분석 결과, 특히 도전적인 1비트 설정에서 EWGS는 더 낮은 학습 손실과 더 높은 검증 정확도를 기록하며 향상된 학습 역학을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.