[논문 리뷰] Audiobox: Unified Audio Generation with Natural Language Prompts
Audiobox는 흐름 매칭 기반의 통합 음성 생성 모델로, 자연어 프롬프트를 사용하여 말, 음악, 사운드 효과를 제어 가능하고 고품질로 생성할 수 있다. 이 모델은 제로샷 텍스트-투-스피치에서 SOTA 성능(리비어스피치 유사도 0.745)과 텍스트-투-사운드 생성에서(FAD 0.77 on AudioCaps) 뛰어난 성능을 기록하며, 기술 기반 및 예시 기반 프롬프팅을 통해 제어력을 향상시키고, Bespoke Solvers를 통해 추론 속도를 25배 향상시켰다.
Audio is an essential part of our life, but creating it often requires expertise and is time-consuming. Research communities have made great progress over the past year advancing the performance of large scale audio generative models for a single modality (speech, sound, or music) through adopting more powerful generative models and scaling data. However, these models lack controllability in several aspects: speech generation models cannot synthesize novel styles based on text description and are limited on domain coverage such as outdoor environments; sound generation models only provide coarse-grained control based on descriptions like "a person speaking" and would only generate mumbling human voices. This paper presents Audiobox, a unified model based on flow-matching that is capable of generating various audio modalities. We design description-based and example-based prompting to enhance controllability and unify speech and sound generation paradigms. We allow transcript, vocal, and other audio styles to be controlled independently when generating speech. To improve model generalization with limited labels, we adapt a self-supervised infilling objective to pre-train on large quantities of unlabeled audio. Audiobox sets new benchmarks on speech and sound generation (0.745 similarity on Librispeech for zero-shot TTS; 0.77 FAD on AudioCaps for text-to-sound) and unlocks new methods for generating audio with novel vocal and acoustic styles. We further integrate Bespoke Solvers, which speeds up generation by over 25 times compared to the default ODE solver for flow-matching, without loss of performance on several tasks. Our demo is available at https://audiobox.metademolab.com/
연구 동기 및 목표
- 기존 음성 생성 모델의 제어 불가능성과 모odal별 제한성을 해결하기 위해.
- 기술 기반 및 예시 기반 프롬프팅을 통해 단일 프레임워크 내에서 말과 사운드 생성을 통합하기 위해.
- 자기지도 학습 인페일링 목표를 통해 라벨이 적은 데이터에서의 일반화 능력을 향상시키기 위해.
- 말 생성에서 보컬 스타일, 원문 텍스트, 음향 특성에 대한 세밀한 제어를 가능하게 하기 위해.
- 다양하고 실제 생태계의 음성 콘텐츠를 지원하는 확장 가능하고 일반적인 목적의 음성 생성 모델을 개발하기 위해.
제안 방법
- 흐름 매칭 기반의 디퓨전 모델 아키텍처가 텍스트 또는 음성 프롬프트로부터 종단 간 음성 생성을 가능하게 한다.
- 기술 기반 프롬프팅을 통해 텍스트 내용, 보컬 스타일, 음향 환경을 별도로 제어할 수 있다.
- 예시 기반 프롬프팅을 통해 짧은 음성 클립을 이용한 스타일 전이가 가능해져 스타일의 정확도가 향상된다.
- 자기지도 학습 인페일링 목표가 대규모 라벨 없음 음성 데이터에 대한 사전 학습에 적응되어 일반화 능력이 향상된다.
- 표준 ODE 솔버 대비 성능 손실 없이 추론 속도를 25배 이상 향상시키기 위해 Bespoke Solvers가 도입된다.
- 음성과 텍스트 임베딩 간의 정렬을 향상시키기 위해 Joint-CLAP가 사용되어, 다양한 모odal 간 제로샷 일반화 성능이 향상된다.
실험 결과
연구 질문
- RQ1통합 음성 생성 모델이 자연어 프롬프트를 사용해 말, 음악, 사운드와 같은 다양한 모달을 효과적으로 처리할 수 있는가?
- RQ2기술 기반 및 예시 기반 프롬프팅을 어떻게 통합하여 말 생성의 제어력을 향상시킬 수 있는가?
- RQ3자기지도 학습 인페일링 사전 학습이 라벨이 적은 음성 생성 작업에서 성능을 얼마나 향상시킬 수 있는가?
- RQ4Bespoke Solvers와 같은 전용 추론 솔버가 생성 속도와 품질에 어떤 영향을 미치는가?
- RQ5단일 모델이 제로샷 텍스트-투-스피치 및 텍스트-투-사운드 벤치마크에서 SOTA 성능을 달성할 수 있는가?
주요 결과
- Audiobox는 제로샷 텍스트-투-스피치 생성에서 리비어스피치 유사도 점수 0.745를 기록하여 새로운 SOTA 기준을 수립했다.
- AudioCaps 텍스트-투-사운드 생성 벤치마크에서 Audiobox는 프레셰 음향 거리(FAD) 0.77을 기록하여 이전 방법들을 능가했다.
- 모델은 말 생성에서 원문 텍스트, 보컬 스타일, 음향 환경를 별개로 제어할 수 있어, 새로운 보컬 스타일과 음향 환경를 생성할 수 있다.
- Bespoke Solvers는 표준 ODE 솔버 대비 생성 속도를 25배 이상 빠르게 하면서도 생성 품질을 유지한다.
- 자기지도 학습 인페일링 목표는 라벨이 적은 데이터에서 일반화 능력을 크게 향상시키며, 특히 드문 또는 복잡한 음향 패턴에 대해 유의미한 개선 효과가 있다.
- Joint-CLAP 정렬은 말, 음악, 사운드 생성 작업 간 제로샷 전이 성능을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.