[논문 리뷰] Music2Video: Automatic Generation of Music Video with fusion of audio and text
이 논문은 CLIP 기반 가이던스를 통해 음악과 텍스트 임베딩을 융합함으로써 고품질이자 시간적으로 일관된 음악 비디오를 생성하는 Music2Video 프레임워크를 제안한다. 음악의 온셋 강도를 기반으로 한 동적 음악 분할을 통해 장면 전환을 결정하고, 공동 음악-텍스트 프롬프트를 사용한 반복적인 잠재 공간 최적화를 적용하여 CLIP 벡터 융합과 시간 정규화를 통해 시각적으로 일관된 비디오 생성을 달성한다.
Creation of images using generative adversarial networks has been widely adapted into multi-modal regime with the advent of multi-modal representation models pre-trained on large corpus. Various modalities sharing a common representation space could be utilized to guide the generative models to create images from text or even from audio source. Departing from the previous methods that solely rely on either text or audio, we exploit the expressiveness of both modality. Based on the fusion of text and audio, we create video whose content is consistent with the distinct modalities that are provided. A simple approach to automatically segment the video into variable length intervals and maintain time consistency in generated video is part of our method. Our proposed framework for generating music video shows promising results in application level where users can interactively feed in music source and text source to create artistic music videos. Our code is available at https://github.com/joeljang/music2video.
연구 동기 및 목표
- 음악과 가사 텍스트 콘텐츠 양쪽에 일관되게 부합하는 음악 비디오를 생성하는 데 도전하는 것.
- 다중 모odal 생성에서 음악과 텍스트 모odal 간의 충돌하는 지시를 효과적으로 융합하여 극복하는 것.
- 온셋 강도와 같은 음악 통계의 변화를 감지하여 음악 기반의 동적 장면 전환을 가능하게 하는 것.
- 잠재 공간 정규화와 프롬프트 융합을 통해 생성된 비디오 프레임 간의 시간적 일관성을 유지하는 것.
- 사용자가 음악과 텍스트 입력을 통해 최소한의 사용자 간섭으로도 예술적인 음악 비디오를 생성할 수 있는 상호작용 가능한 시스템을 제공하는 것.
제안 방법
- 온셋 강도 검출을 통해 가변 길이의 간격으로 음악을 분할하여 자연스러운 장면 전환 지점을 식별하는 것.
- 각 음악 세그먼트를 멜-스펙트로그램으로 변환하고 평균 강도를 계산하여 생성에 대한 프레임/초 수를 결정하는 것.
- 음악과 텍스트 프롬프트를 CLIP 임베딩으로 인코딩하고 평균화(식 (2))를 통해 융합하여 공동 지시를 제공하는 것.
- 융합된 CLIP 벡터를 사용해 VQ-GAN에서 반복적인 잠재 공간 최적화를 적용하여 양 모달에 부합하는 프레임을 생성하는 것.
- 연속된 잠재 벡터 간의 L1 거리 정규화(식 (1))와 평균화된 CLIP 프롬프트를 사용하여 시간적 일관성을 확보하는 것.
- 융합된 음악-텍스트 잠재 코드에서 고해상도 이미지를 생성하기 위해 적대적 손실과 재구성 손실을 사용하는 VQ-GAN 생성자 사용하는 것.
실험 결과
연구 질문
- RQ1충돌하는 지시가 발생할 수 있는 음악과 텍스트 모달을 효과적으로 융합하여 음악 비디오 생성을 지도할 수 있는 방법은 무엇인가?
- RQ2음악 통계(예: 온셋 강도) 기반으로 자연스러운 장면 전환 지점을 효과적으로 감지할 수 있는 방법은 무엇인가?
- RQ3반복적인 잠재 공간 최적화 과정에서 비디오 프레임 간의 시간적 일관성을 유지하는 방법은 무엇인가?
- RQ4CLIP 임베딩을 통한 공동 음악-텍스트 프롬프트가 단일 모달 프롬프트보다 더 일관성 있고 예술적으로 의미 있는 비디오 시퀀스를 생성할 수 있는가?
- RQ5음악 온셋 기반의 동적 분할이 고정 간격 분할에 비해 시각적 일관성과 주제 일치 측면에서 어떻게 비교되는가?
주요 결과
- CLIP 임베딩 평균화(식 (2))를 통한 음악과 텍스트 융합은 잠재 벡터의 L1 정규화에 비해 시각적 일관성 측면에서 뚜렷한 향상을 보였다.
- 온셋 강도 기반의 동적 분할은 더 자연스럽고 음악적으로 일치하는 장면 전환을 가능하게 하였으며, 평균 세그먼트 길이는 0.6초였다.
- 이 방법은 그림 2와 그림 3에서 보듯이 이전 프레임의 객체가 유지되는 시간적으로 일관된 비디오 시퀀스를 성공적으로 생성하였다.
- 음악과 텍스트 프롬프트를 모두 사용할 경우, 가사와의 수준별 정렬을 통해 단일 모달 사용보다 더 주제에 부합하는 비디오 콘텐츠를 생성하였다.
- 이 프레임워크는 사용자가 음악과 가사를 입력하여 최소한의 간섭으로도 예술적인 음악 비디오를 생성할 수 있는 상호작용 가능한 음악 비디오 제작을 가능하게 하였다.
- 이 방법은 음악과 텍스트 프롬프트를 번갈아가며 사용하는 난이도 높은 반복 최적화 방식보다 성능이 뛰어나며, 이는 일관성 없는 시각적 출력을 초래하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.