Skip to main content
QUICK REVIEW

[논문 리뷰] Learning in the Frequency Domain

Kai Xu, Minghai Qin|arXiv (Cornell University)|2020. 02. 27.
Advanced Neural Network Applications참고 문헌 2인용 수 14
한 줄 요약

이 논문은 고해상도 이미지의 공간적 다운샘플링을 회피하기 위해 디지털 코사인 변환(DCT) 계수를 딥 네ural 네트워크의 입력으로 사용하여 주파수 도메인에서 학습하는 방법을 제안한다. 이는 기존의 공간적 리사이징 방식보다 높은 정확도를 달성하며, 주요 주파수 성분의 정적 채널 선택을 통해 입력 크기와 통신 대역폭을 줄인다. ImageNet에서 ResNet-50을 사용할 경우 최대 +1.60%의 상위-1 정확도 향상을 기록한다.

ABSTRACT

Deep neural networks have achieved remarkable success in computer vision tasks. Existing neural networks mainly operate in the spatial domain with fixed input sizes. For practical applications, images are usually large and have to be downsampled to the predetermined input size of neural networks. Even though the downsampling operations reduce computation and the required communication bandwidth, it removes both redundant and salient information obliviously, which results in accuracy degradation. Inspired by digital signal processing theories, we analyze the spectral bias from the frequency perspective and propose a learning-based frequency selection method to identify the trivial frequency components which can be removed without accuracy loss. The proposed method of learning in the frequency domain leverages identical structures of the well-known neural networks, such as ResNet-50, MobileNetV2, and Mask R-CNN, while accepting the frequency-domain information as the input. Experiment results show that learning in the frequency domain with static channel selection can achieve higher accuracy than the conventional spatial downsampling approach and meanwhile further reduce the input data size. Specifically for ImageNet classification with the same input size, the proposed method achieves 1.41% and 0.66% top-1 accuracy improvements on ResNet-50 and MobileNetV2, respectively. Even with half input size, the proposed method still improves the top-1 accuracy on ResNet-50 by 1%. In addition, we observe a 0.8% average precision improvement on Mask R-CNN for instance segmentation on the COCO dataset.

연구 동기 및 목표

  • 딥 러닝에서 고해상도 이미지의 공간적 다운샘플링으로 인한 정확도 저하 문제를 해결한다.
  • AI 추론 시스템에서 높은 칩 간 통신 대역폭이 문제되는 것을 해결한다.
  • CNN의 스펙트럼 편향과 인간 시각 시스템을 활용하여 제거 가능한 비필수 주파수 성분을 식별한다.
  • 기존 CNN 모델의 공간 전처리를 대체할 수 있는 보편적이고 최소한의 수정을 가진 방법을 개발한다.
  • 주파수 도메인 학습과 정적 채널 프루닝을 통해 입력 크기를 줄이며 더 높은 정확도를 달성한다.

제안 방법

  • 고해상도 RGB 이미지를 주파수 도메인 표현으로 변환하기 위해 이산 코사인 변환(DCT)을 사용하여 DCT 계수로 변환한다.
  • 표준 CNN 아키텍처(예: ResNet-50, MobileNetV2, Mask R-CNN)에 최소한의 아키텍처 수정으로 DCT 계수를 직접 입력한다.
  • 각 주파수 채널마다 'on-off 스위치'를 사용하여 학습 기반의 동적 채널 선택 메커니즘을 구현하여 비중요 성분을 식별하고 제거한다.
  • 스펙트럼 편향 분석에 기반하여 정적 채널 선택을 적용하여 최대 87.5%의 주파수 채널을 프루닝하면서 정확도에 영향을 주지 않는다.
  • 모델 성능을 유지하면서 입력 크기를 줄이기 위해 고해상도 복원 이미지를 학습 및 추론에 사용한다.
  • CPU와 가속기 간의 입력 데이터 크기와 통신 대역폭을 줄여 추론 최적화를 이룬다.

실험 결과

연구 질문

  • RQ1공간적 리사이징 대비 주파수 도메인 이미지 표현이 딥 러닝 정확도 향상에 기여할 수 있는가?
  • RQ2비필수 주파수 성분을 얼마나 제거해도 모델 성능이 저하되지 않을까?
  • RQ3CNN의 스펙트럼 편향과 인간 시각 시스템의 감도가 주파수 대역에 따라 어떻게 비교되는가?
  • RQ4기존 CNN 파ip라인의 공간 전처리를 대체할 수 있는 보편적이고 최소한의 수정 방법을 개발할 수 있는가?
  • RQ5정확도를 유지하면서 주파수 도메인 프루닝을 통해 얼마나 큰 입력 크기의 감소를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 동일한 입력 크기에서 ResNet-50을 사용할 경우 기존 공간 리사이징 대비 ImageNet에서 +1.60%의 상위-1 정확도 향상을 달성한다.
  • MobileNetV2의 경우 동일한 입력 조건에서 +0.63%의 상위-1 정확도 향상을 기록한다.
  • 입력 크기를 반으로 줄였음에도 불구하고, ResNet-50의 정확도는 ImageNet에서 +1.42% 상위-1 정확도 향상을 기록한다.
  • COCO 데이터셋에서 Mask R-CNN를 사용할 경우 객체 검출 및 인스턴스 세그멘테이션 모두에서 평균 정밀도가 +0.8% 향상된다.
  • 정적 채널 선택 방법을 통해 ImageNet에서 최대 87.5%의 주파수 채널을 프루닝하면서 정확도 저하 없이 또는 극히 미미한 저하로 유지할 수 있다.
  • 주파수 도메인 접근 방식은 입력 데이터 크기와 칩 간 통신 대역폭을 줄여 AI 추론 시스템의 핵심 병목 현상을 완화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.