Skip to main content
QUICK REVIEW

[논문 리뷰] Hidden-Fold Networks: Random Recurrent Residuals Using Sparse Supermasks

Ángel López García-Arias, Masanori Hashimoto|arXiv (Cornell University)|2021. 11. 24.
Advanced Neural Network Applications참고 문헌 33인용 수 4
한 줄 요약

이 논문은 잠재적인 접힘 신경망(HFNs)을 제안하며, 잔차 연결을 접고, 가중치 업데이트 없이도 희박한 슈퍼마스크를 통해 고정확도의 하위망을 발견함으로써 ResNets를 매우 효율적인 순환 아키텍처로 압축하는 방법을 제시한다. HFN은 CIFAR100과 ImageNet에서 ResNet 수준의 성능를 달성하면서도 메모리 용량을 26.8배에서 38.5배까지 줄여, 외부 메모리 액세스를 최소화함으로써 전용 하드웨어에서 초저에너지 추론을 가능하게 한다. 이는 랜덤이고 재사용 가능한 가중치와 이진 슈퍼마스크를 통해 달성된다.

ABSTRACT

Deep neural networks (DNNs) are so over-parametrized that recent research has found them to already contain a subnetwork with high accuracy at their randomly initialized state. Finding these subnetworks is a viable alternative training method to weight learning. In parallel, another line of work has hypothesized that deep residual networks (ResNets) are trying to approximate the behaviour of shallow recurrent neural networks (RNNs) and has proposed a way for compressing them into recurrent models. This paper proposes blending these lines of research into a highly compressed yet accurate model: Hidden-Fold Networks (HFNs). By first folding ResNet into a recurrent structure and then searching for an accurate subnetwork hidden within the randomly initialized model, a high-performing yet tiny HFN is obtained without ever updating the weights. As a result, HFN achieves equivalent performance to ResNet50 on CIFAR100 while occupying 38.5x less memory, and similar performance to ResNet34 on ImageNet with a memory size 26.8x smaller. The HFN will become even more attractive by minimizing data transfers while staying accurate when it runs on highly-quantized and randomly-weighted DNN inference accelerators. Code available at https://github.com/Lopez-Angel/hidden-fold-networks

연구 동기 및 목표

  • 큰 DNN의 높은 메모리 및 에너지 비용을 해결하기 위해 ResNets를 매우 효율적이고 저메모리 아키텍처로 압축하는 것.
  • 랜덤으로 초기화된 네트워크에서 라운드트립 티켓 가설과 하위망 탐색을 활용해 접힌 순환 구조 내에서 정확하고 학습되지 않은 하위망을 찾는 것.
  • 온칩 메모리에 희박한 슈퍼마스크와 랜덤 시드를 저장함으로써 외부 메모리 액세스를 최소화하여 에너지 효율적인 DNN 추론을 가능하게 하는 것.
  • ResNets를 순환 구조로 접는 것이 표준 피드포워드 모델에 비해 숨겨진 하위망의 정확도를 향상시키는지 탐구하는 것.
  • 저전력 및 고정량화 추론 가속기에서 구동 가능한, 작고 정확한 모델을 설계하는 것.

제안 방법

  • 동일한 가중치 세트를 여러 시간 단계에 걸쳐 재사용함으로써 표준 ResNet을 순환 아키텍처로 접는 것.
  • 가중치를 업데이트하지 않고도 랜덤으로 초기화된 접힌 네트워크 내에서 희박하고 고성능의 하위망을 식별하기 위해 학습 가능한 이진 슈퍼마스크를 사용하는 것.
  • 이진 마스크의 미분 가능한 근사화를 통해 슈퍼마스크를 학습시키며, 정확도를 최적화하면서도 희박성을 유지하는 것.
  • 희박한 슈퍼마스크를 활용해 추론 중에 순환적으로 재사용되는 가중치의 일부만 선택적으로 활성화함으로써 효율적인 이진 연산을 가능하게 하는 것.
  • 고정된 학습되지 않은 가중치를 생성하기 위해 랜덤 시드를 사용함으로써 외부 메모리에 매개변수를 저장할 필요 없이 제거하는 것.
  • 전용 추론 가속기와 호환되도록 아키텍처를 설계함으로써 온칩 랜덤 넘버 생성 및 이진 마스크 연산을 지원하는 것.

실험 결과

연구 질문

  • RQ1표준 피드포워드 모델에 비해 슈퍼마스크 기반 하위망 탐색을 통해 접힌 순환 구조 내에서 숨겨진 하위망의 정확도가 향상되는가?
  • RQ2가중치 접기와 슈퍼마스크 기반 하위망 탐색을 조합함으로써 깊은 네트워크의 메모리 용량을 얼마나 줄일 수 있는가?
  • RQ3CIFAR100과 ImageNet과 같은 표준 벤치마크에서 HFN의 정확도 및 모델 크기 측면에서 표준 ResNets와의 성능 비교는 어떠한가?
  • RQ4온칩 슈퍼마스크 및 랜덤 시드 저장을 통해 외부 메모리 액세스를 최소화함으로써 HFN이 상당한 에너지 절감을 달성할 수 있는가?
  • RQ5정확도를 극대화하면서 모델 크기 및 계산 비용을 최소화하기 위한 최적의 슈퍼마스크 조밀도와 학습 스케줄은 무엇인가?

주요 결과

  • HFN은 CIFAR100에서 ResNet50와 유사한 정확도를 달성하면서도 메모리 용량을 1/38.5로 줄여 모델 크기를 38.5배 감소시켰다.
  • ImageNet에서 HFN은 원본 모델보다 메모리 용량이 26.8배 작은 ResNet34의 성능을 재현했다.
  • 45 nm CMOS 추론 가속기에서 DRAM에서 모델을 로드하는 에너지 비용이 두 개의 지수 단위 감소했으며, 이는 최소한의 외부 메모리 액세스 덕분이었다.
  • 단일 RTX 3090에서 HFN의 슈퍼마스크 학습은 1 에포크당 149초가 소요되었고, 전체 ResNet50는 44초였으며, 이는 막대한 추론 절감을 위해 훈련 비용의 교환을 의미한다.
  • 매개변수를 온칩 SRAM에 저장함으로써 랜덤 시드와 희박한 이진 슈퍼마스크만으로도 전용 하드웨어에 배포가 가능하며, DRAM 액세스가 필요 없어졌다.
  • HFN은 매우 정량화된 가중치와 이진 슈퍼마스크를 사용해도 성능가 유지되며, 에너지 효율적이고 저정밀도 추론 가속기와 매우 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.