[논문 리뷰] WavJourney: Compositional Audio Creation with Large Language Models
WavJourney는 자연어 지시어를 통해 구성적 오디오 생성을 가능하게 하는 혁신적인 프레임워크이다. 이 프레임워크는 자연어 지시어를 바탕으로 구조화된 오디오 스크립트를 생성하고, 이를 실행 가능한 프로그램으로 컴파일하며, 전문화된 오디오 모델을 조율하여 현실적이고 시간적·공간적으로 정렬된 오디오 콘텐츠를 생성한다. 텍스트-오디오 벤치마크에서 최고 성능을 기록했으며, 오디오 스토리텔링과 인간-기계 공동 창작 분야에서도 뛰어난 성능을 보였다.
Despite breakthroughs in audio generation models, their capabilities are often confined to domain-specific conditions such as speech transcriptions and audio captions. However, real-world audio creation aims to generate harmonious audio containing various elements such as speech, music, and sound effects with controllable conditions, which is challenging to address using existing audio generation systems. We present WavJourney, a novel framework that leverages Large Language Models (LLMs) to connect various audio models for audio creation. WavJourney allows users to create storytelling audio content with diverse audio elements simply from textual descriptions. Specifically, given a text instruction, WavJourney first prompts LLMs to generate an audio script that serves as a structured semantic representation of audio elements. The audio script is then converted into a computer program, where each line of the program calls a task-specific audio generation model or computational operation function. The computer program is then executed to obtain a compositional and interpretable solution for audio creation. Experimental results suggest that WavJourney is capable of synthesizing realistic audio aligned with textually-described semantic, spatial and temporal conditions, achieving state-of-the-art results on text-to-audio generation benchmarks. Additionally, we introduce a new multi-genre story benchmark. Subjective evaluations demonstrate the potential of WavJourney in crafting engaging storytelling audio content from text. We further demonstrate that WavJourney can facilitate human-machine co-creation in multi-round dialogues. To foster future research, the code and synthesized audio are available at: https://audio-agi.github.io/WavJourney_demopage/.
연구 동기 및 목표
- 기존 오디오 생성 모델이 음성 전사나 캡션과 같은 도메인 전용 조건에 국한되어 있는 한계를 해결하기 위해.
- 말, 음악, 사운드 이펙트 등 다양한 요소를 자연어 지시어에 따라 복잡하고 조화로운 오디오 콘텐츠로 생성할 수 있도록 하기 위해.
- 다회차 대화를 통해 인간-기계 공동 창작을 지원하는 해석 가능하고 상호작용 가능한 파이프라인을 설계하기 위해.
- 오디오 요소 간의 의미적, 시간적, 공간적 관계에 정밀한 제어를 가능하게 하는 구성적 오디오 생성 프레임워크를 개발하기 위해.
- 실제적이고 매력적인 오디오 생성을 평가하기 위한 새로운 다장르 오디오 스토리텔링 벤치마크를 구축하기 위해.
제안 방법
- 프레임워크는 먼저 LLM을 활용해 말, 음악, 사운드 이펙트 및 그들의 시공간적 관계를 기술하는 구조화된 오디오 스크립트를 생성한다.
- 오디오 스크립트는 각 줄이 작업별 전용 오디오 생성 모델이나 계산 함수를 호출하는 컴퓨터 프로그램으로 컴파일된다.
- 실행 프로그램은 전문 오디오 생성 모델 세트를 사용하여 오디오 요소를 제어되고 해석 가능한 방식으로 합성 및 조합한다.
- 시스템은 다회차 대화를 통해 사용자 상호작용을 지원하며, 자연어를 통해 오디오 콘텐츠를 수정하거나 확장할 수 있다.
- 스크립트 컴파일러는 의미적 오디오 스크립트를 실행 가능한 코드로 변환하여 오디오 요소의 정확한 순서와 믹싱을 보장한다.
- 프레임워크는 오디오 생성 모델의 콘텐츠 생성뿐 아니라 계획 수립과 오디오 제작 파이프라인 조율에도 LLM을 활용한다.
실험 결과
연구 질문
- RQ1LLM은 말, 음악, 사운드 이펙트와 같은 다양한 오디오 요소 간의 복잡한 시공간적 관계를 담은 구조화된 오디오 스크립트를 효과적으로 생성할 수 있는가?
- RQ2이러한 스크립트에서 유도된 컴파일된 프로그램은 정밀한 타이밍 및 공간적 배치 제어를 통해 정확하고 구성적인 오디오 생성을 가능하게 하는가?
- RQ3WavJourney의 구성적 접근 방식은 텍스트-오디오 생성 모델의 엔드 투 엔드 방식과 비교해 음질, 정렬 정도, 해석 가능성 측면에서 어떻게 다른가?
- RQ4WavJourney는 오디오 제작 분야에서 상호작용적이고 다회차적인 인간-기계 공동 창작을 어느 정도 지원할 수 있는가?
- RQ5주관적 평가를 통해 WavJourney는 다양한 장르에서 매력적이고 현실적인 오디오 스토리텔링 콘텐츠를 생성할 수 있는가?
주요 결과
- WavJourney는 텍스트-오디오 생성 벤치마크에서 최고 성능을 기록했으며, 평가된 모든 측면에서 AudioLDM 및 AudioGen을 모두 앞서 갔다.
- 주관적 평가 결과 WavJourney는 참여도 3.28, 창의성 3.18, 관련성 3.52, 정서적 공명 3.04, 박자 및 템포 2.97의 점수를 기록했으며, 기준 모델보다 유의미하게 높았다.
- WavJourney는 명확한 발화를 성공적으로 생성했으며, 시간적 정렬(예: 'as'를 사용한 동시 사건, 'follow'로 순차적 사건)과 기술된 대로의 공간 레이아웃을 유지했다.
- 시스템은 인간-기계 공동 창작에서 뛰어난 내재성과 유연성을 보였으며, 자연어를 통해 새로운 사운드 이벤트 추가나 지속시간 조정 등의 동적 수정이 가능했다.
- 프레임워크는 텍스트 기반 기술과 정확하게 일치하는 청각적 정렬을 보였고, AudioGen과 AudioLDM는 종종 일관성 없거나 이해할 수 없는 발화를 생성했다.
- 본 연구는 새로운 다장르 오디오 스토리텔링 벤치마크를 제공하며, 향후 연구를 위해 코드와 합성 오디오를 공개했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.