Skip to main content
QUICK REVIEW

[論文レビュー] Audiobox: Unified Audio Generation with Natural Language Prompts

Apoorv Vyas, Bowen Shi|arXiv (Cornell University)|Dec 25, 2023
Music and Audio Processing被引用数 5
ひとこと要約

Audiobox は、フローマッチングに基づく統合型音声生成モデルであり、自然言語プロンプトを用いて制御可能で高品質な音声、音楽、サウンドエフェクトの合成を可能にする。0.745 の Librispeech 同一性スコアでゼロショット音声合成(text-to-speech)で最先端の結果を達成し、AudioCaps では 0.77 の FAD を記録。説明ベースおよび例ベースのプロンプティングにより制御性が向上し、Bespoke Solvers を用いることで推論速度が大幅に向上している。

ABSTRACT

Audio is an essential part of our life, but creating it often requires expertise and is time-consuming. Research communities have made great progress over the past year advancing the performance of large scale audio generative models for a single modality (speech, sound, or music) through adopting more powerful generative models and scaling data. However, these models lack controllability in several aspects: speech generation models cannot synthesize novel styles based on text description and are limited on domain coverage such as outdoor environments; sound generation models only provide coarse-grained control based on descriptions like "a person speaking" and would only generate mumbling human voices. This paper presents Audiobox, a unified model based on flow-matching that is capable of generating various audio modalities. We design description-based and example-based prompting to enhance controllability and unify speech and sound generation paradigms. We allow transcript, vocal, and other audio styles to be controlled independently when generating speech. To improve model generalization with limited labels, we adapt a self-supervised infilling objective to pre-train on large quantities of unlabeled audio. Audiobox sets new benchmarks on speech and sound generation (0.745 similarity on Librispeech for zero-shot TTS; 0.77 FAD on AudioCaps for text-to-sound) and unlocks new methods for generating audio with novel vocal and acoustic styles. We further integrate Bespoke Solvers, which speeds up generation by over 25 times compared to the default ODE solver for flow-matching, without loss of performance on several tasks. Our demo is available at https://audiobox.metademolab.com/

研究の動機と目的

  • 既存の音声生成モデルにおける制御性の欠如とモダリティ特異的制限を解消すること。
  • 説明ベースおよび例ベースのプロンプティングを併用することで、音声とサウンド生成を統合的フレームワークで統一すること。
  • 自己教師ありインフィリング目的を用いて、ラベルが限られたデータでも一般化性能を向上させること。
  • 音声生成におけるボーカルスタイル、トランスクリプト、音声属性に対する細分化された制御を可能とすること。
  • 多様で現実世界の音声コンテンツをサポートするスケーラブルかつ汎用的な音声生成モデルの開発

提案手法

  • フローマッチングに基づく拡散モデルアーキテクチャにより、テキストまたは音声プロンプトからのエンドツーエンド音声生成を実現。
  • 説明ベースのプロンプティングにより、テキスト内容、ボーカルスタイル、音響環境を独立して制御可能。
  • 例ベースのプロンプティングにより、短い音声クリップを用いたスタイル転送が可能になり、スタイルの忠実度が向上。
  • 自己教師ありインフィリング目的を大規模なラベルなし音声データへの事前学習に適応させ、一般化性能を向上。
  • 標準の ODE スolver よりも 25 倍以上高速化するが性能損なわず、Bespoke Solvers を導入。
  • 音声とテキスト埋め込みを整列させるために Joint-CLAP が使用され、モダリティ間のゼロショット一般化性能が向上。

実験結果

リサーチクエスチョン

  • RQ1統合型音声生成モデルは、自然言語プロンプトを用いて、音声、音楽、サウンドといった多様なモダリティを効果的に処理できるか?
  • RQ2説明ベースおよび例ベースのプロンプティングをどのように統合することで、音声生成における制御性が向上するか?
  • RQ3自己教師ありインフィリング事前学習は、リソースが限られた音声生成タスクにおける性能向上にどの程度寄与するか?
  • RQ4Bespoke Solvers のような専用推論スルーバーが生成速度と品質に与える影響はいかほどか?
  • RQ51 つのモデルがゼロショット音声合成および音声生成ベンチマークで最先端の性能を達成できるか?

主な発見

  • Audiobox はゼロショット音声合成タスクで Librispeech 同一性スコア 0.745 を達成し、新たな SOTA ベンチマークを樹立。
  • AudioCaps テキストからサウンド生成ベンチマークでは、Fréchet Audio Distance (FAD) が 0.77 に達し、先行手法を上回った。
  • 音声生成において、トランスクリプト、ボーカルスタイル、音響環境を独立して制御可能であり、これにより新しいボーカルスタイルや音響環境の再現が可能になった。
  • Bespoke Solvers を用いることで、標準の ODE スルーバーと比較して音声生成速度が 25 倍以上向上したが、生成品質に損なわれはなかった。
  • 自己教師ありインフィリング目的は、特にレアまたは複雑な音声パターンにおいて、ラベルが限られたデータでの一般化性能を顕著に向上させた。
  • Joint-CLAP 整列により、音声、音楽、サウンド生成タスク間でのゼロショット転送性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。