[論文レビュー] WavJourney: Compositional Audio Creation with Large Language Models
WavJourney は、自然言語の指示に基づいて構成的音声生成を可能にする画期的なフレームワークである。大規模言語モデル(LLMs)を活用し、構造的な音声スクリプトを生成し、それを実行可能プログラムにコンパイルし、特殊な音声モデルを調整して、時間的・空間的に整合したリアルな音声コンテンツを生成する。テキストから音声へのベンチマークで最先端の結果を達成し、音声ストーリーテリングや人間と機械の共同創造において優れたパフォーマンスを示している。
Despite breakthroughs in audio generation models, their capabilities are often confined to domain-specific conditions such as speech transcriptions and audio captions. However, real-world audio creation aims to generate harmonious audio containing various elements such as speech, music, and sound effects with controllable conditions, which is challenging to address using existing audio generation systems. We present WavJourney, a novel framework that leverages Large Language Models (LLMs) to connect various audio models for audio creation. WavJourney allows users to create storytelling audio content with diverse audio elements simply from textual descriptions. Specifically, given a text instruction, WavJourney first prompts LLMs to generate an audio script that serves as a structured semantic representation of audio elements. The audio script is then converted into a computer program, where each line of the program calls a task-specific audio generation model or computational operation function. The computer program is then executed to obtain a compositional and interpretable solution for audio creation. Experimental results suggest that WavJourney is capable of synthesizing realistic audio aligned with textually-described semantic, spatial and temporal conditions, achieving state-of-the-art results on text-to-audio generation benchmarks. Additionally, we introduce a new multi-genre story benchmark. Subjective evaluations demonstrate the potential of WavJourney in crafting engaging storytelling audio content from text. We further demonstrate that WavJourney can facilitate human-machine co-creation in multi-round dialogues. To foster future research, the code and synthesized audio are available at: https://audio-agi.github.io/WavJourney_demopage/.
研究の動機と目的
- 既存の音声生成モデルが、話し言葉の転写やキャプションといったドメイン特化された条件に限定されているという制限に対処すること。
- 自然言語の指示に従って、話し言葉、音楽、サウンドエフェクトといった複数の要素を含む、複雑で調和の取れた音声コンテンツを生成できるようにすること。
- 自然言語によるマルチラウンド対話によって支援される、解釈可能でインタラクティブなパイプラインを設計すること。
- 音声要素間の意味的・時間的・空間的関係に対して正確な制御が可能な、構成的音声生成フレームワークを開発すること。
- リアルで魅力的な音声生成を評価するための、新規のマルチジェネル音声ストーリーテリングベンチマークを確立すること。
提案手法
- フレームワークはまず、LLM を用いて、話し言葉、音楽、サウンドエフェクトとその空間的・時間的関係を記述する構造的な音声スクリプトを生成する。
- 音声スクリプトは、各行がタスク固有の音声生成モデルまたは計算関数を呼び出す実行可能プログラムにコンパイルされる。
- プログラムは専門的な音声生成モデルのセットを用いて実行され、音声要素の合成と構成を制御可能で解釈可能な方法で実現する。
- システムはマルチラウンド対話による動的なユーザー相互作用をサポートし、自然言語による音声コンテンツの変更や拡張が可能である。
- スクリプトコンパイラは、意味的な音声スクリプトを実行可能コードに変換し、音声要素の正しい順序付けとミキシングを保証する。
- フレームワークは、コンテンツ生成に加え、音声生産パイプラインの計画と調整の両方において LLM を活用する。
実験結果
リサーチクエスチョン
- RQ1LLM は、話し言葉、音楽、サウンドエフェクトといった多様な音声要素間の複雑な空間的・時間的関係を記述する構造的音声スクリプトを効果的に生成できるか?
- RQ2このようなスクリプトから導出されたコンパイル済みプログラムは、タイミングや空間的位置の正確な制御が可能な、正確な構成的音声生成を可能にするか?
- RQ3WavJourney の構成的アプローチは、エンドツーエンドのテキストから音声へのモデルと比較して、音声品質、整合性、解釈可能性の面でどのように異なるか?
- RQ4WavJourney は、音声制作におけるインタラクティブでマルチラウンドの共同創造をどの程度サポートできるか?
- RQ5WavJourney は、主観的評価によって裏付けられる多様なジャンルにわたる魅力的でリアルな音声ストーリーテリングコンテンツを生成できるか?
主な発見
- WavJourney は、テキストから音声への生成ベンチマークで最先端のパフォーマンスを達成し、すべての評価項目で AudioLDM や AudioGen を上回った。
- 主観的評価では、WavJourney のスコアは、エンゲージメントで 3.28、クリエイティビティで 3.18、関連性で 3.52、感情的共鳴で 3.04、テンポと進行具合で 2.97 であり、ベースラインと比べて顕著に上回った。
- WavJourney は、聞き取りやすい話し言葉を生成し、時間的整合性(例:'as' を用いた同時発生イベント、'follow' を用いた順次イベント)を正しく維持し、記述された空間的レイアウトを保持した。
- システムは、人間と機械の共同創造においても強固な性能を示し、自然言語による新しいサウンドイベントの追加や、持続時間の調整といった動的な変更が可能だった。
- フレームワークは、テキスト記述と知覚的に整合した音声を生成したが、AudioGen や AudioLDM はしばしば一貫性のない、聞き取りにくい話し言葉を生成していた。
- 本研究では、新規のマルチジェネル音声ストーリーテリングベンチマークを提供し、今後の研究を目的にコードと合成音声を公開した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。