Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Convolutional Neural Networks in the Frequency Domain

Hengyue Pan, Chen, Yixin|arXiv (Cornell University)|2022. 04. 14.
Neural Networks and Applications인용 수 5
한 줄 요약

이 논문은 이산 푸리에 변환(DFT)을 사용해 주로 주파수 도메인에서 훈련되는 새로운 컨volution 신경망인 CEMNET을 제안한다. 기존의 계산 비용이 높은 컨볼루션을 교차상관정리에 기반해 효율적인 원소 간 곱셈으로 대체한다. 과적합을 완화하기 위해 웨이트 픽스레이션 메커니즘을 도입하였으며, 배치 정규화, 리 leaky ReLU, 드롭아웃의 주파수 도메인 등가체를 설계하여 MNIST 및 CIFAR-10에서 최신 기준 성능을 달성하였다. FLOPs가 감소한 상태에서 CIFAR-10에서 70% 이상의 정확도를 기록했으며, 이는 주파수 도메인에서 동작하는 모델 중 처음으로 이 성과를 이룬 것이다.

ABSTRACT

Convolutional neural network (CNN) has achieved impressive success in computer vision during the past few decades. The image convolution operation helps CNNs to get good performance on image-related tasks. However, the image convolution has high computation complexity and hard to be implemented. This paper proposes the CEMNet, which can be trained in the frequency domain. The most important motivation of this research is that we can use the straightforward element-wise multiplication operation to replace the image convolution in the frequency domain based on the Cross-Correlation Theorem, which obviously reduces the computation complexity. We further introduce a Weight Fixation mechanism to alleviate the problem of over-fitting, and analyze the working behavior of Batch Normalization, Leaky ReLU, and Dropout in the frequency domain to design their counterparts for CEMNet. Also, to deal with complex inputs brought by Discrete Fourier Transform, we design a two-branches network structure for CEMNet. Experimental results imply that CEMNet achieves good performance on MNIST and CIFAR-10 databases.

연구 동기 및 목표

  • 컨volution 신경망의 계산 복잡도를 주파수 도메인에서 직접 학습함으로써 감소시키는 것.
  • DFT로 인해 입력이 복소수 값이 되는 주파수 도메인 훈련의 과제를 해결하고, 효과적인 역전파를 가능하게 하는 것.
  • 배치 정규화, 리 leaky ReLU, 드롭아웃과 같은 표준 딥러닝 컴포넌트의 주파수 도메인 등가체를 설계하는 것.
  • 새로운 웨이트 픽스레이션 메커니즘을 통해 주파수 도메인 훈련에서의 과적합을 극복하는 것.
  • 이식 가능한 엔드 투 엔드 주파수 도메인 훈련이 이미지 분류 작업에서 가능하고 효과적임을 입증하며, 표준 벤치마크에서 경쟁 가능한 성능을 달성하는 것.

제안 방법

  • 핵심 메커니즘은 교차상관정리에 기반해 주파수 도메인에서 이미지 컨볼루션을 원소 간 곱셈으로 대체하는 것으로, 이는 입력의 DFT와 필터의 복소수 켤레의 원소 간 곱이 교차상관의 DFT와 동일하다는 것을 의미한다.
  • DFT로 생성된 복소수 특징 맵을 처리하기 위해 복소수 값을 다룰 수 있는 이중 브랜치 네트워크 아키텍처를 설계하여 역전파 중 실수 값의 가중치 갱신을 가능하게 한다.
  • 초기 블록의 가중치를 동결함으로써 학습 가능한 파rameter 수를 줄여 과적합을 감소시키는 웨이트 픽스레이션 메커니즘을 도입한다.
  • 학습 안정성과 일반화 성능을 유지하기 위해 배치 정규화, 리 leaky ReLU, 드롭아웃의 주파수 도메인 적응형을 유도하고 구현한다.
  • 표준 최적화 기법을 사용하며, 코즈인 감소 학습률 스케줄을 적용하고, CIFAR-10 실험에서는 데이터 증강을 적용하지 않는다.
  • 계산 효율성 향상을 정량화하기 위해 전방 및 역방향 연산의 FLOPs를 측정한다.

실험 결과

연구 질문

  • RQ1DFT를 사용해 주파수 도메인에서 컨볼루션 신경망을 엔드 투 엔드로 훈련시킬 수 있는가? 기존 컨볼루션 연산을 원소 간 곱셈으로 대체할 수 있는가?
  • RQ2배치 정규화, ReLU, 드롭아웃과 같은 표준 딥러닝 컴포넌트를 주파수 도메인에서 효과적으로 적응시키는 방법은 무엇인가?
  • RQ3특히 파arameter 갱신이 제한된 상황에서 주파수 도메인 훈련에서 과적합을 완화하기 위해 어떤 메커니즘이 사용될 수 있는가?
  • RQ4주파수 도메인 네트워크는 MNIST 및 CIFAR-10과 같은 표준 비전 벤치마크에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5전방 및 역방향 전파의 FLOPs 측면에서 주파수 도메인 훈련의 계산 복잡도는 기존 CNN과 비교해 어떻게 되는가?

주요 결과

  • CEMNET은 MNIST 데이터셋에서 테스트 오차 0.67%를 기록하여 이전의 주파수 도메인 모델을 능가하고 표준 CNN에 근접한 성능을 달성하였다.
  • CIFAR-10에서 소형 CEMNET는 테스트 오차 22.40%를 기록하였으며, 이는 소형 CNN(21.07%)와 유사한 성능을 보여, FLOPs가 감소한 상태에서도 강력한 일반화 능력을 입증하였다.
  • 대형 CEMNET는 CIFAR-10에서 테스트 오차 21.63%를 기록하여 모델의 깊이 증가에 따라 성능이 합리적으로 확장됨을 보여주었지만, 웨이트 픽스레이션으로 인한 기울기 소실로 인해 전체 크기의 CNN에 비해 성능이 뒤처졌다.
  • CEMNET의 전방 및 역방향 FLOP 수치는 각각 약 368K와 481K로, 표준 CNN에 비해 크게 감소하여 뚜렷한 계산 자원 절감 효과를 보였다.
  • CEMNET는 주파수 도메인 모델 중 처음으로 CIFAR-10에서 70% 이상의 정확도를 달성하여 주파수 도메인 딥러닝 분야에서 중요한 전환점이 되었다.
  • 이중 브랜치 네트워크 아키텍처는 복소수 값을 가진 DFT 출력을 효과적으로 처리하며, 실수 값의 기울기로 안정적인 훈련을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.