[논문 리뷰] nnAudio: An on-the-fly GPU Audio to Spectrogram Conversion Toolbox Using 1D Convolution Neural Networks
nnAudio는 PyTorch 기반의 GPU 가속 오디오 처리 도구상자로, 1D 합성곱 신경망을 사용하여 원시 웨이브폼에서 STFT, 멜 스펙트로그램, CQT로의 실시간, 미분 가능한 스펙트로그램 변환을 수행한다. 이는 스펙트로그램 추출 시간을 librosa의 몇 초에서 밀리초 수준으로 단축시키며, 변환 계층의 엔드 투 엔드 학습을 가능하게 하고, CPU 기반 방법 대비 최대 1000배의 속도 향상을 달성한다.
Converting time domain waveforms to frequency domain spectrograms is typically considered to be a prepossessing step done before model training. This approach, however, has several drawbacks. First, it takes a lot of hard disk space to store different frequency domain representations. This is especially true during the model development and tuning process, when exploring various types of spectrograms for optimal performance. Second, if another dataset is used, one must process all the audio clips again before the network can be retrained. In this paper, we integrate the time domain to frequency domain conversion as part of the model structure, and propose a neural network based toolbox, nnAudio, which leverages 1D convolutional neural networks to perform time domain to frequency domain conversion during feed-forward. It allows on-the-fly spectrogram generation without the need to store any spectrograms on the disk. This approach also allows back-propagation on the waveforms-to-spectrograms transformation layer, which implies that this transformation process can be made trainable, and hence further optimized by gradient descent. nnAudio reduces the waveforms-to-spectrograms conversion time for 1,770 waveforms (from the MAPS dataset) from $10.64$ seconds with librosa to only $0.001$ seconds for Short-Time Fourier Transform (STFT), $18.3$ seconds to $0.015$ seconds for Mel spectrogram, $103.4$ seconds to $0.258$ for constant-Q transform (CQT), when using GPU on our DGX work station with CPU: Intel(R) Xeon(R) CPU E5-2698 v4 @ 2.20GHz Tesla v100 32Gb GPUs. (Only 1 GPU is being used for all the experiments.) We also further optimize the existing CQT algorithm, so that the CQT spectrogram can be obtained without aliasing in a much faster computation time (from $0.258$ seconds to only $0.001$ seconds).
연구 동기 및 목표
- 신경망 하이퍼파ram터 검색 중에 여러 스펙트로그램 유형을 사전에 계산하고 저장하는 데 드는 비효율성과 높은 스토리지 비용을 해결하기 위해.
- GPU에서 직접 실시간으로 스펙트로그램 추출을 가능하게 하여 디스크 I/O 병목 현상과 CPU-GPU 데이터 전송 오버헤드를 제거하기 위해.
- 스펙트로그램 변환 계층을 신경망 내에서 학습 가능한 것으로 만들며, 작업에 특화된 성능을 위해 푸리에 커널, 멜 필터 백터, CQT 커널을 최적화할 수 있도록 하기 위해.
- STFT, 멜 스펙트로그램, CQT를 지원하며 엔드 투 엔드의 미분 가능성까지 갖춘 빠르고 확장 가능하며 사용자 친화적인 GPU 기반 오디오 처리 라이브러리를 제공하기 위해.
- 기존의 CPU 및 GPU 기반 라이브러리(예: librosa, Kapre, torchaudio)보다 처리 속도에서 뛰어나며, 새로운 학습 가능한 CQT 구현 방식을 지원하기 위해.
제안 방법
- STFT, 멜, CQT를 학습 가능한 레이어로 간주하여, PyTorch에서 1D 합성곱 신경망을 활용해 시간 도메인에서 주파수 도메인으로의 변환을 구현한다.
- CUDA를 지원하는 1D 컨벌루션을 사용해 GPU에서 직접 스펙트로그램 계산을 수행함으로써, CPU-GPU 데이터 전송을 피하고 실시간 처리를 가능하게 한다.
- 푸리에 커널, 멜 필터 백터, CQT 커널을 백프로파게이션 중에 업데이트 가능한 파라미터로 표현한다.
- 시간 도메인 커널을 사용해 CQT를 구현하며, 기존의 주파수 도메인 커널 방법보다 빠른 성능을 보임을 입증한다.
- 모든 스펙트로그램 유형(STFT, 멜, CQT)을 일관된, 학습 가능한 프레임워크 내에서 구성 가능한 파라미터로 지원하며, 단일 프레임워크에서 계산한다.
- 중간 스펙트로그램의 디스크 저장을 피함으로써 메모리 사용량을 최적화하고, 학습 중 실시간 생성을 가능하게 한다.
실험 결과
연구 질문
- RQ1딥 러닝 기반의 GPU 가속 프레임워크는 librosa와 같은 CPU 기반 라이브러리보다 상당히 더 빠른 스펙트로그램 추출을 달성할 수 있는가?
- RQ2스펙트로그램 변환 레이어를 신경망 내에서 학습 가능한 것으로 만들면, 후속 모델 성능 향상에 기여하는가?
- RQ31D 컨벌루션을 사용해 GPU에서 학습 가능한 CQT 계산을 효율적으로 구현할 수 있으며, 기존의 주파수 도메인 커널 방법보다 뛰어난 성능을 보이는가?
- RQ4학습 가능한 변환 레이어를 갖춘 실시간 스펙트로그램 생성은 사전 계산된 비학습 가능한 스펙트로그램에 비해 학습 시간을 단축시키고 모델 정확도를 향상시키는가?
- RQ5소비자용 GPU와 고성능 DGX 시스템 등 다양한 하드웨어 플랫폼에서 이 프레임워크의 처리 속도와 메모리 효율성 측면에서의 확장성은 어떠한가?
주요 결과
- nnAudio는 STFT 추출 시간을 librosa의 CPU 기반 10.6초에서 GPU 기반 0.001초로 단축시켜 10,000배의 속도 향상을 달성했다.
- 멜 스펙트로그램 계산은 librosa 기반 18.3초에서 nnAudio 기반 0.015초로 단축되어 1,200배 향상되었다.
- CQT 처리 시간은 librosa 기반 103.4초에서 nnAudio 기반 0.258초로 단축되어 400배의 속도 향상이 이루어졌다.
- MusicNet 데이터셋에서 nnAudio는 스펙트로그램 추출 총 시간을 librosa 기반 983분에서 99분으로 줄여 90%의 감소를 이뤘다.
- nnAudio에서 시간 도메인 CQT 커널을 사용함으로써 기존의 주파수 도메인 커널 방법보다 더 빠른 계산이 가능했으며, 1,770개의 웨이브폼에 대해 CQT 처리 시간을 0.258초에서 0.001초로 단축시켰다.
- 스펙트로그램 변환 레이어(예: 푸리에 커널, 멜 필터)를 학습시킬 경우, 비학습 가능한 커널 대비 주파수 예측 작업에서 더 낮은 MSE 손실을 기록하며, 엔드 투 엔드 최적화의 이점을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.