Skip to main content
QUICK REVIEW

[논문 리뷰] I Hear Your True Colors: Image Guided Audio Generation

Roy Sheffer, Yossi Adi|arXiv (Cornell University)|2022. 11. 06.
Music and Audio Processing인용 수 5
한 줄 요약

이 논문은 이미지 또는 영상에서 의미적으로 관련성이 있는 오디오를 생성하기 위해 CLIP로 인코딩된 이미지 특징에 조건부인 두 단계의 트랜스포머 기반 언어 모델을 활용하는 새로운 이미지 유도 오디오 생성 시스템인 Im2Wav를 제안한다. 이 방법은 오디오의 명료성과 시각적 관련성 측면에서 최신 기술 수준의 성능을 달성하며, FAD, Clip-Score, KL 발산 등의 지표에서 기준 모델들을 크게 능가한다. 또한, 이질적 도메인 평가를 위한 ImageHear 벤치마크를 도입한다.

ABSTRACT

We propose Im2Wav, an image guided open-domain audio generation system. Given an input image or a sequence of images, Im2Wav generates a semantically relevant sound. Im2Wav is based on two Transformer language models, that operate over a hierarchical discrete audio representation obtained from a VQ-VAE based model. We first produce a low-level audio representation using a language model. Then, we upsample the audio tokens using an additional language model to generate a high-fidelity audio sample. We use the rich semantics of a pre-trained CLIP (Contrastive Language-Image Pre-training) embedding as a visual representation to condition the language model. In addition, to steer the generation process towards the conditioning image, we apply the classifier-free guidance method. Results suggest that Im2Wav significantly outperforms the evaluated baselines in both fidelity and relevance evaluation metrics. Additionally, we provide an ablation study to better assess the impact of each of the method components on overall performance. Lastly, to better evaluate image-to-audio models, we propose an out-of-domain image dataset, denoted as ImageHear. ImageHear can be used as a benchmark for evaluating future image-to-audio models. Samples and code can be found inside the manuscript.

연구 동기 및 목표

  • 텍스트나 클래스 레이블, 텍스트-오디오 데이터 쌍이 필요 없이 개방형 도메인에서 의미적으로 관련성이 있는 오디오를 생성하는 이미지 유도 오디오 생성 시스템을 개발하는 것.
  • 비디오에서 자연스럽게 발생하는 이미지-오디오 쌍을 활용하여 대규모 텍스트-오디오 쌍 데이터셋의 부족함을 보완하는 것.
  • 계층적인 이산 토큰 모델링 방법을 통해 이미지-오디오 생성에서 오디오의 명료성과 시각적 관련성을 향상시키는 것.
  • 이미지-오디오 모델의 평가를 표준화하기 위해 ImageHear라는 새로운 이질적 도메인 벤치마크 데이터셋을 도입하는 것.
  • 분류기 자유 가이던스, 업샘플링, 프레임 단위 조건부 설정과 같은 핵심 구성 요소가 생성 품질에 미치는 영향을 조사하는 것.

제안 방법

  • Im2Wav는 원시 오디오를 저해상도 수준에서 이산 토큰으로 변환하기 위해 계층적인 VQ-VAE를 사용한다.
  • 첫 번째 단계의 자동회귀 트랜스포머 언어 모델이 CLIP로 인코딩된 이미지 특징에 조건부하여 저수준의 이산 오디오 토큰을 생성한다.
  • 두 번째 단계의 자동회귀 트랜스포머가 저수준 토큰을 고해상도로 업샘플링하여 더 높은 명료도의 오디오로 정밀화한다.
  • 분류기 자유 가이던스를 적용하여 생성된 오디오와 입력 이미지 간의 일치도를 향상시켜 시각적 관련성을 강화한다.
  • 시스템은 단일 이미지 또는 이미지 시퀀스(영상)에 조건부로 작동하며, 각 프레임에서 CLIP 특징을 추출한다.
  • 오디오 생성은 두 단계 모델에서 자동으로 회귀적으로 샘플링한 후 VQ-VAE 디코더를 통해 디코딩하여 수행된다.

실험 결과

연구 질문

  • RQ1텍스트-음성 스타일의 언어 모델 아키텍처가 텍스트나 클래스 레이블 없이도 고해상도이자 의미적으로 관련성이 있는 오디오를 이미지에서 생성하는 데 적합한가?
  • RQ2CLIP로 인코딩된 이미지 특징에 조건부로 설정할 경우, 다른 시각적 표현 방식에 비해 오디오의 관련성과 품질 측면에서 어떤가?
  • RQ3분류기 자유 가이던스는 개방형 오디오 생성에서 이미지-오디오 일치도 향상에 어떤 영향을 미치는가?
  • RQ4업샘플링, 프레임 단위 조건부 설정, 분류기 자유 가이던스와 같은 개별 구성 요소가 최종 오디오 생성 성능에 미치는 영향은 어떠한가?
  • RQ5ImageHear와 같은 새로운 이질적 도메인 벤치마크가 이미지-오디오 생성 모델에 대해 신뢰할 수 있고 표준화된 평가 프로토콜을 제공할 수 있는가?

주요 결과

  • Im2Wav는 Fréchet Audio Distance (FAD)가 6.41로, 이어지는 최선의 기준 모델(8.86)을 크게 능가한다.
  • ImageHear 벤치마크에서 Im2Wav는 Clip-Score (CS) 9.53과 오디오 분류기 정확도 49.14%를 기록하여 강력한 시각적 관련성과 클래스 분포 일치를 보여준다.
  • 분류기 자유 가이던스(CFG)는 시각적 관련성을 향상시키며, 업샘플링과 함께 사용했을 때 CS는 7.30에서 9.53으로, 정확도는 26.67%에서 49.14%로 증가한다.
  • 업샘플링 모델의 통합으로 FAD는 12.47에서 6.41로 감소하여 오디오 명료도 향상이 뚜렷하게 나타난다.
  • 제거 실험 결과, CFG와 업샘플링 모두 성능 향상에 강력하고 독립적인 영향을 미치며, 프레임 단위 조건부 설정(Every)은 더 작은 영향을 미친다.
  • 제안된 ImageHear 벤치마크는 신뢰할 수 있는 이질적 도메인 평가를 가능하게 하며, 결과적으로 단일 이미지에서는 복잡한 영상 시퀀스보다 더 우수한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.