[논문 리뷰] AdderNet: Do We Really Need Multiplications in Deep Learning?
이 논문은 컨볼루션 신경망에서 계산 비용이 높은 곱셈 연산을 필터와 특징 맵 간의 ℓ₁-노름 거리 측도를 사용하여 효율적인 덧셈으로 대체하는 새로운 딥러닝 아키텍처인 AdderNets를 제안한다. 이 방법은 컨볼루션 레이어에서 곱셈을 전혀 사용하지 않고도 ImageNet에서 74.9%의 Top-1 정확도를 달성하며, 덧셈 전용 네트워크가 CNN 성능을 따라잡을 수 있음을 보여주며 계산 비용을 극적으로 감소시킨다.
Compared with cheap addition operation, multiplication operation is of much higher computation complexity. The widely-used convolutions in deep neural networks are exactly cross-correlation to measure the similarity between input feature and convolution filters, which involves massive multiplications between float values. In this paper, we present adder networks (AdderNets) to trade these massive multiplications in deep neural networks, especially convolutional neural networks (CNNs), for much cheaper additions to reduce computation costs. In AdderNets, we take the $\ell_1$-norm distance between filters and input feature as the output response. The influence of this new similarity measure on the optimization of neural network have been thoroughly analyzed. To achieve a better performance, we develop a special back-propagation approach for AdderNets by investigating the full-precision gradient. We then propose an adaptive learning rate strategy to enhance the training procedure of AdderNets according to the magnitude of each neuron's gradient. As a result, the proposed AdderNets can achieve 74.9% Top-1 accuracy 91.7% Top-5 accuracy using ResNet-50 on the ImageNet dataset without any multiplication in convolution layer. The codes are publicly available at: https://github.com/huaweinoah/AdderNet.
연구 동기 및 목표
- 딥 신경망이 곱셈 연산을 완전히 제거하면서도 정확도를 유지할 수 있는지 조사하는 것.
- 오직 덧셈 연산만을 사용하는 하드웨어 효율적인 표준 컨볼루션의 대안을 설계하는 것.
- 최소한의 기울기 소멸 현상이 발생하는 ℓ₁-거리 유사도 기반 네트워크의 안정적인 학습 절차를 개발하는 것.
- 계산 복잡도를 감소시켜 모바일 및 엣지 디바이스에서 저전력으로 딥 네트워크를 구동할 수 있도록 하는 것.
제안 방법
- 입력 특징 맵과 학습 가능한 필터 간의 ℓ₁-노름 거리 계산을 표준 컨볼루션 연산으로 대체하여, 덧셈과 뺄셈(2의 보수를 통한) 연산만을 포함한다.
- 학습을 안정화하고 ℓ₁-기반 네트워크에서 기울기 소멸 현상을 방지하기 위해 정밀도를 유지하는 기울기 기반 역전파 기법을 도입한다.
- 기울기 크기에 따라 각 레이어별로 학습률을 조정하는 적응형 학습률 스케일링 전략을 제안하여 수렴성을 향상시킨다.
- 특히 초기 학습 단계에서 충분한 필터 갱신을 보장하기 위해 정규화된 기울기 갱신을 사용한다.
- 특징 분포와 가중치 분포를 시각화하여 ℓ₁-기반 네트워크가 라플라스 분포와 유사한 가중치 분포를 가지며 클래스 구별 능력을 갖춘 표현을 학습하고 있음을 확인한다.
실험 결과
연구 질문
- RQ1ℓ₁-노름 거리가 컨볼루션에서 표준 내적 연산을 대체할 수 있는 타당하고 효과적인 유사도 측도로 활용될 수 있는가?
- RQ2곱셈 없이 오직 덧셈 연산만을 사용하는 깊은 신경망을 학습시켜도 경쟁력 있는 정확도를 유지할 수 있는가?
- RQ3절댓값 함수가 0에서 미분 가능하지 않기 때문에, ℓ₁-기반 네트워크에서 기울기 최적화를 어떻게 안정화할 수 있는가?
- RQ4수렴성과 높은 성능를 달성하기 위해 필요한 학습 전략, 예를 들어 적응형 학습률 또는 정밀도 유지 기반 기울기 등은 무엇인가?
주요 결과
- AdderNets는 컨볼루션 레이어에서 곱셈을 전혀 사용하지 않고도 ResNet-50 아키텍처를 사용해 ImageNet에서 74.9%의 Top-1 정확도와 91.7%의 Top-5 정확도를 달성한다.
- 제안된 정밀도 유지 기반 기울기와 적응형 학습률 전략 덕분에 AdderNets는 LeNet-5-BN을 사용해 MNIST에서 99.40%의 정확도를 달성하며, 표준 CNN과 동일한 성능을 보인다.
- AdderNets의 가중치 분포는 ℓ₁-노름 사전 지식과 일치하는 라플라스 분포를 따르며, 반면 CNN의 가중치 분포는 가우시안 분포를 따른다.
- 특징 시각화 결과, AdderNets는 CNN보다 더 뚜렷한 클래스 군집화 표현을 생성함으로써 ℓ₁-유사도 기반에서 더 뛰어난 구별 능력을 보임을 확인할 수 있다.
- 절연 분석 결과, 정밀도 유지 기반 기울기와 적응형 학습률 스케일링 전략이 높은 성능을 내기 위해 필수적임을 확인하였으며, 기울기의 부호만을 사용하는 경우 MNIST에서 정확도가 29.26%에 불과했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.