Skip to main content
QUICK REVIEW

[논문 리뷰] MP3net: coherent, minute-long music generation from raw audio with a simple convolutional GAN

Korneel van den Broek|arXiv (Cornell University)|2021. 01. 12.
Speech and Audio Processing참고 문헌 30인용 수 5
한 줄 요약

MP3net는 원시 음성 신호에서 MDCT 변환된 진폭 표현을 사용하여 직접 스테레오 음악을 고품질로 일관성 있게 생성하는 딥 컨volution형 GAN이다. 청각적 마스킹과 점진적, 맥락 인지형 아키텍처를 통해 깊이 있는 레이어에서 전체 트랙 수신장이 보장되도록 하여 안정적인 훈련과 거의 즉각적인 추론을 달성하였으며, 단일 클라우드 TPUv2에서 250시간 훈련 후 95초 길이의 오디오 샘플을 생성한다.

ABSTRACT

We present a deep convolutional GAN which leverages techniques from MP3/Vorbis audio compression to produce long, high-quality audio samples with long-range coherence. The model uses a Modified Discrete Cosine Transform (MDCT) data representation, which includes all phase information. Phase generation is hence integral part of the model. We leverage the auditory masking and psychoacoustic perception limit of the human ear to widen the true distribution and stabilize the training process. The model architecture is a deep 2D convolutional network, where each subsequent generator model block increases the resolution along the time axis and adds a higher octave along the frequency axis. The deeper layers are connected with all parts of the output and have the context of the full track. This enables generation of samples which exhibit long-range coherence. We use MP3net to create 95s stereo tracks with a 22kHz sample rate after training for 250h on a single Cloud TPUv2. An additional benefit of the CNN-based model architecture is that generation of new songs is almost instantaneous.

연구 동기 및 목표

  • 원시 음성에서부터 심벌 음악이나 MIDI에 의존하지 않고 장시간, 일관성 있고 고해상도의 음악 샘플을 생성하는 것.
  • MP3/Vorbis 압축 기반 청각적 원리를 활용하여 원시 음성 생성에 필요한 계산 자원을 줄이는 것.
  • 청각적으로 감지되지 않는 청각적 노이즈를 사용하여 실제 데이터 분포의 지원을 넓혀 GAN 훈련을 안정화하는 것.
  • 전체 맥락 수신장을 갖춘 깊은 컨volution형 신경망 아키텍처를 통해 거의 즉각적인 오디오 생성을 가능하게 하는 것.
  • 더 깊은 네트워크 레이어가 전체 시간적 맥락에 접근할 수 있도록 함으로써 생성된 음악의 장거리 일관성을 확보하는 것.

제안 방법

  • 모델은 전체 위상 정보를 유지하는 수정된 이산余弦변환(MDCT) 진폭 표현을 사용하여 스펙트로그램 역변환 없이 직접 오디오 재구성 가능.
  • 판별자 훈련 중 청각적으로 감지되지 않는 청각적 노이즈를 적용하여 실제 데이터 분포의 지원을 넓히고 훈련 안정성을 향상시킴.
  • 생성자 아키텍처는 시간 축을 따라 점차 해상도를 높이고 주파수 축을 따라 더 높은 옥타브를 추가하며, 깊이 있는 레이어는 전체 맥락 입력을 수신.
  • 점진적 훈련은 더 높은 옥타브를 합산을 통해 더 낮은 옥타브에 통합함으로써 깊은 레이어 훈련을 위한 축소된 스펙트로그램을 생성하며, 블러링 없이 구현.
  • 배치 정규화 대신 픽셀 단위의 특징 정규화를 사용하여 MDCT 진폭 공간에서의 안정성을 유지.
  • 조건부 GAN 설정으로 훈련하며, 후반 훈련 단계에서 더 깊은 레이어를 동결하여 노이즈를 감소시키고 음질을 향상시킴.

실험 결과

연구 질문

  • RQ1MDCT 진폭 표현에서 훈련된 GAN이 원시 음성에서부터 일관성 있고 고품질의 1분 분량의 스테레오 음악 샘플을 생성할 수 있는가?
  • RQ2인간 청각의 청각적 특성을 어떻게 활용하여 GAN 훈련을 안정화하고 계산 요구량을 줄일 수 있는가?
  • RQ3깊은 레이어에서 전체 맥락 수신장을 갖춘 CNN 기반 아키텍처가 생성된 음악의 장거리 시간적 일관성을 어느 정도 보장할 수 있는가?
  • RQ4점진적 훈련을 MDCT 기반 오디오 표현에 적응시킬 수 있는가? 이 과정에서 중요한 신호 정보를 손실 없이 유지할 수 있는가?
  • RQ5위상 보존 MDCT 표현 방식은 스펙트로그램 기반 방법과 비교해 음질과 훈련 안정성 측면에서 어떤가?

주요 결과

  • MP3net는 22kHz에서 95초 길이의 스테레오 오디오 샘플을 높은 청각적 품질과 강한 장거리 일관성으로 성공적으로 생성.
  • 청각적으로 감지되지 않는 청각적 노이즈를 주입함으로써 훈련을 안정화시켜, 데이터 분포를 넓히고 모드 붕괴를 완화.
  • 깊은 레이어에서 전체 맥락 수신장이 존재해 모델이 시작부터 끝까지 음악적으로 일관된 구조를 생성할 수 있으며, 시간적 일관성 향상.
  • 효율적인 CNN 아키텍처 덕분에 추론이 거의 즉각적이며 실시간 응용에 적합.
  • 위상 보존 MDCT 표현 방식을 사용함으로써 스펙트로그램 역변환의 필요성을 제거하고 생성 파이프라인 단순화.
  • 단일 클라우드 TPUv2에서 250시간 훈련으로도 고품질 샘플을 생성하여 다른 원시 음성 생성 모델 대비 효율성 입증.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.