[논문 리뷰] Learning Frequency Domain Approximation for Binary Neural Networks
이 논문은 주파수 도메인에서 사인 함수의 기울기를 푸리에 급수를 사용해 근사하는 주파수 도메인 근사(FDA-BNN)라는 새로운 방법을 제안한다. 이 방법은 신호 에너지가 대부분 집중된 저주파 성분을 유지하고, 고주파 근사 오차를 보완하기 위해 노이즈 적응 모듈을 사용함으로써, CIFAR-10과 ImageNet에서 기존 방법보다 최대 1.2% 높은 정확도를 달성한다. ResNet-18에서 최상의 성능을 기록한다.
Binary neural networks (BNNs) represent original full-precision weights and activations into 1-bit with sign function. Since the gradient of the conventional sign function is almost zero everywhere which cannot be used for back-propagation, several attempts have been proposed to alleviate the optimization difficulty by using approximate gradient. However, those approximations corrupt the main direction of factual gradient. To this end, we propose to estimate the gradient of sign function in the Fourier frequency domain using the combination of sine functions for training BNNs, namely frequency domain approximation (FDA). The proposed approach does not affect the low-frequency information of the original sign function which occupies most of the overall energy, and high-frequency coefficients will be ignored to avoid the huge computational overhead. In addition, we embed a noise adaptation module into the training phase to compensate the approximation error. The experiments on several benchmark datasets and neural architectures illustrate that the binary network learned using our method achieves the state-of-the-art accuracy. Code will be available at extit{https://gitee.com/mindspore/models/tree/master/research/cv/FDA-BNN}.
연구 동기 및 목표
- 이진 신경망(BNN)에서 비미분 가능한 부호 함수로 인한 최적화 어려움을 해결하기 위해.
- 기존 방법이 주요 기울기 방향을 왜곡하는 것보다 더 정확한 부호 함수 기울기 근사를 향상시키기 위해.
- 부호 함수의 주요 저주파 성분을 유지함으로써, 대부분의 에너지를 담고 있는 기울기 정보를 정확하게 유지하기 위해.
- 고주파 성분의 푸리에 계수를 잘라내면서도 잔여 오차를 노이즈 적응 모듈로 보완함으로써 계산 비용을 줄이기 위해.
- 주파수 도메인에서 개선된 기울기 추정을 통해 이진 신경망에서 최고 성능을 달성하기 위해.
제안 방법
- 유한한 푸리에 급수(사인 함수로 구성)를 사용해 부호 함수의 기울기를 근사하며, 무한한 항을 사용할 경우 손실이 없는 표현이 가능하다.
- 계산 오버헤드를 줄이기 위해 푸리에 급수를 고정된 항 수(n)로 잘라내며, 신호 에너지가 집중된 저주파 성분을 중심으로 유지한다.
- 고주파 성분의 계수를 잘라내면서 발생하는 근사 오차를 보완하기 위해 학습 중에 노이즈 적응 모듈을 도입한다.
- 학습 중에 푸리에 항의 수(n)를 점진적으로 증가시켜 네트워크가 부호 함수를 점차 더 나은 근사로 학습할 수 있도록 한다.
- 백프로파게이션에서 직렬 전달 추정기(Ste) 대신 푸리에 기반 근사를 사용함으로써, BNN의 엔드 투 엔드 학습을 가능하게 한다.
- 전체 정밀도로 구성된 첫 번째 및 마지막 레이어를 유지하면서, 이중화 컨벌루션 레이어의 가중치와 활성화 모두에 이 방법을 적용한다.
실험 결과
연구 질문
- RQ1이중 신경망(BNN)에서 기존 기울기 추정기보다 주파수 도메인 근사가 부호 함수의 주요 기울기 방향을 더 정확히 유지할 수 있는가?
- RQ2유한한 항 수로 푸리에 급수를 잘라내도 충분한 표현력을 유지하면서 계산 비용을 줄일 수 있는가?
- RQ3노이즈 적응 모듈이 푸리에 기반 기울기 추정기에서 고주파 성분 잘라내기로 발생하는 근사 오차를 효과적으로 보완할 수 있는가?
- RQ4제안된 FDA-BNN 방법이 CIFAR-10과 ImageNet과 같은 표준 벤치마크에서 최고 성능을 기록하는 기존 BNN보다 뛰어난 정확도를 달성할 수 있는가?
- RQ5학습 중에 푸리에 항의 수를 점진적으로 증가시키는 것이 수렴성과 최종 성능에 어떤 영향을 미치는가?
주요 결과
- ResNet-18을 사용한 ImageNet에서 FDA-BNN은 상위 1위 정확도 60.2%와 상위 5위 정확도 82.3%를 기록했으며, Bireal-Net + PReLU 기준보다 각각 1.2%와 1.0% 높다.
- ReActNet의 기울기 계산을 FDA-BNN으로 교체한 경우, 상위 1위 정확도 66.0%, 상위 5위 정확도 86.4%를 달성했으며, 원본 ReActNet보다 각각 0.5%와 0.3% 높다.
- AlexNet에서 FDA-BNN은 상위 1위 정확도 46.2%, 상위 5위 정확도 69.7%를 기록했으며, LNS보다 상위 1위 정확도에서 1.8% 높다.
- 다양한 아키텍처와 데이터셋에서 높은 성능를 유지함으로써 일반화성과 강건성을 입증했다.
- 제거 분석 결과, 학습 중에 푸리에 항 수(n)를 늘릴수록 성능 향상이 이루어지며, 점진적 학습 전략의 타당성을 입증했다.
- 노이즈 적응 모듈이 고주파 성분 잘라내기로 발생하는 오차를 줄여 성능 향상에 기여함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.