Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Spiking Variational Autoencoder

Hiromichi Kamata, Yusuke Mukuta|arXiv (Cornell University)|2021. 09. 26.
Advanced Memory and Neural Computing인용 수 4
한 줄 요약

이 논문은 모든 구성 요소—잠재 공간까지 포함하여 모두 SNN로 구현된 최초의 엔드 투 엔드 스파iking 신경망(SNN) VAE인 풀리 스파이킹 변분 오토에인코더(FSVAE)를 제안한다. 자동회귀 베르누이 스파이크 샘플링을 도입함으로써, 부동소수점 연산 없이도 잠재 베르누이 과정에서의 확률적 샘플링을 가능하게 하여, 에너지 효율성과 속도 면에서 동등한 ANN보다 뛰어난 뉴모르픽 하드웨어에서 고품질의 이미지 생성을 실현한다.

ABSTRACT

Spiking neural networks (SNNs) can be run on neuromorphic devices with ultra-high speed and ultra-low energy consumption because of their binary and event-driven nature. Therefore, SNNs are expected to have various applications, including as generative models being running on edge devices to create high-quality images. In this study, we build a variational autoencoder (VAE) with SNN to enable image generation. VAE is known for its stability among generative models; recently, its quality advanced. In vanilla VAE, the latent space is represented as a normal distribution, and floating-point calculations are required in sampling. However, this is not possible in SNNs because all features must be binary time series data. Therefore, we constructed the latent space with an autoregressive SNN model, and randomly selected samples from its output to sample the latent variables. This allows the latent variables to follow the Bernoulli process and allows variational learning. Thus, we build the Fully Spiking Variational Autoencoder where all modules are constructed with SNN. To the best of our knowledge, we are the first to build a VAE only with SNN layers. We experimented with several datasets, and confirmed that it can generate images with the same or better quality compared to conventional ANNs. The code is available at https://github.com/kamata1729/FullySpikingVAE

연구 동기 및 목표

  • 에너지 제약이 있는 엣지 디바이스에서 스파이킹 신경망(SNN)을 사용하여 고품질의 이미지 생성을 가능하게 하기 위해.
  • SNN는 바이너리 이벤트 기반 스파이크 트레인을 요구하므로 연속적인 잠재 변수를 어떻게 표현할 수 있을지에 도전 과제를 해결하기 위해.
  • 잠재 공간의 품질이 동등하거나 ANN 기반 VAE보다 우수한 수준을 유지하는 완전한 SNN 기반 변분 오토에인코더(VAE)를 개발하기 위해.
  • 샘플링 및 잠재 공간 모델링에서 부동소수점 연산을 제거함으로써 뉴모르픽 하드웨어에서 효율적이고 저전력의 추론을 가능하게 하기 위해.

제안 방법

  • 자동회귀 베르누이 스파이크 샘플링을 제안: 자동회귀 SNN를 사용하여 잠재 스파이크 트레인의 사전 및 사후 분포를 베르누이 과정으로 모델링한다.
  • 입력 이미지를 처리하고 이진 스파이크 트레인을 사용하여 재구성하는 SNN 기반 인코더 및 디코더 네트워크를 활용한다.
  • 추론 중에 뉴모르픽 하드웨어의 난수 생성기를 사용하여 베르누이 분포에 따라 잠재 스파이크 트레인에서 샘플링한다.
  • 잠재 공간의 안정성과 분리도 향상을 위해 MMD 커널에 후행 이동(PSP)을 적용한다.
  • 잠재 공간을 이진 스파이크 이벤트의 시퀀스로 모델링하여 부동소수점 연산을 피하고 뉴모르픽 장치와의 호환성을 확보한다.
  • VAE 손실 함수의 정규화 항으로 Kullback-Leibler(KLD) 또는 최대 평균 차이(MMD)를 사용하여 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1모든 구성 요소가 SNN 레이어로만 이루어진 완전한 스파이킹 VAE를 ANN 성분 없이 구성할 수 있는가?
  • RQ2자동회귀 베르누이 스파이크 샘플링이 SNN와 호환되는 방식으로 잠재 공간을 효과적으로 모델링할 수 있고, 고품질의 이미지 생성을 가능하게 하는가?
  • RQ3제안된 FSVAE가 표준 벤치마크에서 동등한 ANN 기반 VAE와 비교해 이미지 생성 품질이 유사하거나 뛰어나게 성능을 내는가?
  • RQ4특히 뉴모르픽 하드웨어에 구현했을 때, FSVAE의 계산 비용과 추론 속도가 ANN VAE와 비교해 어떻게 되는가?
  • RQ5이산적 스파이크 기반의 잠재 변수가 후행 붕괴를 방지하여 더 의미 있고 분리된 표현을 이끌어낼 수 있는가?

주요 결과

  • FSVAE는 모든 데이터셋(MNIST, FashionMNIST, CIFAR10, CelebA)에서 인ception 스코어 면에서 동등한 ANN VAE를 능가하여 더 높은 품질의 이미지 생성을 나타낸다.
  • MNIST 및 FashionMNIST에서 FSVAE는 ANN VAE보다 낮은 Fréchet Inception Distance(FID)를 기록하여 실제 이미지와의 분포 유사도가 뛰어나다.
  • CIFAR10에서는 FID 및 인ception 스코어를 포함한 모든 지표에서 FSVAE가 더 뛰어난 성능을 보이며 강력한 생성 품질을 입증한다.
  • CelebA에서는 MMD 손실에 커널에 PSP를 적용한 경우, 모든 설정 중에서 가장 낮은 FID를 기록하여 잠재 공간 품질 향상을 확인한다.
  • FSVAE의 계산 비용은 승산 연산 기준으로 크게 감소했으며(5.6×10⁸ 대비 ANN의 7.4×10⁹), 뉴모르픽 하드웨어에서 SNN 추론은 약 100배 빠를 것으로 예상된다.
  • 잠재 표현에 최적의 타임스텝은 16로 확인되었고, 채널 배수자수 k=20에서 최고의 FID 성능을 기록하여 하이퍼파rameter 선택에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.