Skip to main content
QUICK REVIEW

[논문 리뷰] VampNet: Music Generation via Masked Acoustic Token Modeling

Hugo Flores García, Prem Seetharaman|arXiv (Cornell University)|2023. 07. 10.
Music and Audio Processing인용 수 7
한 줄 요약

VampNet는 병렬 반복 디코딩을 사용하여 마스킹된 음향 토큰을 예측함으로써 고음질 음악을 생성하는 비자기적, 이방향 트랜스포머 모델이다. 다양한 프롬프팅 전략을 통해 유연한 음악 생성, 압축, 인페인팅, 변형을 가능하게 하며, NVIDIA RTX3090에서 단 36회의 샘플링 스텝으로 최신 기준 FAD 점수를 달성한다.

ABSTRACT

We introduce VampNet, a masked acoustic token modeling approach to music synthesis, compression, inpainting, and variation. We use a variable masking schedule during training which allows us to sample coherent music from the model by applying a variety of masking approaches (called prompts) during inference. VampNet is non-autoregressive, leveraging a bidirectional transformer architecture that attends to all tokens in a forward pass. With just 36 sampling passes, VampNet can generate coherent high-fidelity musical waveforms. We show that by prompting VampNet in various ways, we can apply it to tasks like music compression, inpainting, outpainting, continuation, and looping with variation (vamping). Appropriately prompted, VampNet is capable of maintaining style, genre, instrumentation, and other high-level aspects of the music. This flexible prompting capability makes VampNet a powerful music co-creation tool. Code and audio samples are available online.

연구 동기 및 목표

  • 압축, 인페인팅, 변형과 같은 다양한 오디오 조작 작업을 지원하는 비자기적 음악 생성 모델을 개발하는 것.
  • 이산 음향 토큰에서 병렬 반복 디코딩을 사용하여 효율적이고 고품질의 오디오 합성을 구현하는 것.
  • 주기적, 비트 기반, 인페인팅과 같은 다양한 프롬프팅 전략의 효과를 탐색하여 생성 행동을 제어하는 것.
  • 자기적 생성 없이도 이방향 어텐션을 사용한 마스킹 토큰 모델링이 일관되고 스타일적으로 일관된 음악을 생성할 수 있는지 입증하는 것.
  • 프롬프트 기반 제어를 통해 음악 공동 창작 및 오디오 조작에 활용할 수 있는 유연하고 오픈소스 도구를 제공하는 것.

제안 방법

  • VampNet는 단일 프로퍼스에서 모든 토큰에 대해 어텐션을 수행하는 이방향 트랜스포머 아키텍처를 사용하여 비자기적 생성을 가능하게 한다.
  • 학습 중에 변동 가능한 마스킹 스케줄을 적용하여 입력 토큰을 마스킹하고, 모델이 마스킹된 값을 예측하도록 학습시킨다.
  • 추론 시에는 병렬 반복 디코딩을 사용한다: 각 스텝에서 모델은 가장 확신도가 높은 예측된 토큰을 샘플링하고, 순차적으로 시퀀스를 개선한다.
  • 모델은 프롬프팅을 통해 조건화된다 — 입력 시퀀스가 특정 패턴(예: 주기적, 비트에 맞춘, 또는 무작위)으로 마스킹되어 생성을 이끌어낸다.
  • 오디오는 먼저 사전 학습된 오디오 토크나이저(예: DAC)를 사용하여 토큰화되고, 그 결과로 생성된 이산 토큰은 VampNet에서 처리된 후 다시 오디오로 디코딩된다.
  • 다양한 프롬프팅 전략(예: 압축, 주기적, 비트 기반)을 통해 모델은 재구성에서 창의적 변형에 이르기까지 다양한 범위에서 작동할 수 있다.
Figure 1 : VampNet overview. We first convert audio into a sequence of discrete tokens using an audio tokenizer. Tokens are masked, and then passed to a masked generative model, which predicts values for masked tokens via an efficient iterative parallel decoding sampling procedure at two levels. We
Figure 1 : VampNet overview. We first convert audio into a sequence of discrete tokens using an audio tokenizer. Tokens are masked, and then passed to a masked generative model, which predicts values for masked tokens via an efficient iterative parallel decoding sampling procedure at two levels. We

실험 결과

연구 질문

  • RQ1비자기적, 이방향 트랜스포머 모델이 최소한의 샘플링 스텝으로 마스킹된 음향 토큰에서 고음질 음악을 생성할 수 있는가?
  • RQ2주기적, 비트 기반, 인페인팅과 같은 다양한 프롬프팅 전략이 음악 생성 및 변형을 얼마나 효과적으로 이끄는가?
  • RQ3VampNet는 어떤 정도로 음악의 청각적 품질과 음악적 구조를 유지하면서 압축을 수행할 수 있는가?
  • RQ4샘플링 스텝 수와 마스킹 밀도에 따라 모델의 성능은 어떻게 변하는가?
  • RQ5프롬프팅을 사용한 마스킹 음향 토큰 모델링이 일관되고 스타일적으로 일관된 입력 음악의 변형을 생성할 수 있는가?

주요 결과

  • VampNet는 36회의 샘플링 스텝으로 가장 낮은 Fréchet Audio Distance(FAD)를 기록하며, 품질과 속도 면에서 자기적 기준 모델들을 모두 능가한다.
  • 24회의 샘플링 스텝으로 VampNet는 NVIDIA RTX3090에서 10초 분량의 오디오를 약 6초 내로 생성하며, 유사한 파rameter를 가진 자기적 모델의 경우 약 1분이 소요된다.
  • 비트 기반 프롬프팅이 가장 낮은 FAD를 기록하여, 다른 프롬프팅 방법보다 더 뛰어난 청각적 품질과 더 나은 템포 일관성을 보였다.
  • P=16(35개 조건 토큰)로 주기적 프롬프팅을 적용한 결과, 1초의 컨텍스트(57개 토큰)를 가진 인페인팅과 유사한 성능을 보였으며, 이는 분산된 조건부 입력이 효율성을 향상시킨다는 것을 시사한다.
  • 200 bps 이하의 비트레이트에서 VampNet는 무작위 토큰 기준보다 낮은 FAD를 유지하여, 낮은 재구성 품질에도 불구하고 여전히 음악적으로 타당한 오디오를 생성한다는 것을 보여준다.
  • 주기적 프롬프팅과 압축 프롬프팅을 조합하면 마스킹 비율이 증가함에 따라 재구성에서 창의적 생성으로 매끄럽게 전환할 수 있다.
Figure 2 : Training, sampling, and prompting VampNet. Training : we train VampNet using Masked Acoustic Token Modeling, where we randomly mask a portion of a set of input acoustic tokens and learn to predict the masked set of tokens, using a variable masking schedule. Coarse model training masks coa
Figure 2 : Training, sampling, and prompting VampNet. Training : we train VampNet using Masked Acoustic Token Modeling, where we randomly mask a portion of a set of input acoustic tokens and learn to predict the masked set of tokens, using a variable masking schedule. Coarse model training masks coa

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.