Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Cross-Modal Audio-Visual Generation

Lele Chen, Sudhanshu Srivastava|arXiv (Cornell University)|2017. 04. 26.
Music and Audio Processing참고 문헌 31인용 수 7
한 줄 요약

이 논문은 조건부 생성 적대적 네트워크(cGANs)를 사용하여 교차 모odal 오디오-비디오 생성을 위한 최초의 딥 생성 모델을 소개한다. 이 모델은 오디오에서 시각적 이미지를 합성하고, 비디오 이미지에서 오디오 스펙트로그램을 생성할 수 있다. 방법은 악기 수준 및 자세 수준의 생성에서 뛰어난 성능을 보이며, 분류 및 인간 평가를 통해 검증되었다. 또한 향후 연구를 위해 두 가지 새로운 데이터셋인 Sub-URMP와 INIS를 기여하였다.

ABSTRACT

Cross-modal audio-visual perception has been a long-lasting topic in psychology and neurology, and various studies have discovered strong correlations in human perception of auditory and visual stimuli. Despite works in computational multimodal modeling, the problem of cross-modal audio-visual generation has not been systematically studied in the literature. In this paper, we make the first attempt to solve this cross-modal generation problem leveraging the power of deep generative adversarial training. Specifically, we use conditional generative adversarial networks to achieve cross-modal audio-visual generation of musical performances. We explore different encoding methods for audio and visual signals, and work on two scenarios: instrument-oriented generation and pose-oriented generation. Being the first to explore this new problem, we compose two new datasets with pairs of images and sounds of musical performances of different instruments. Our experiments using both classification and human evaluations demonstrate that our model has the ability to generate one modality, i.e., audio/visual, from the other modality, i.e., visual/audio, to a good extent. Our experiments on various design choices along with the datasets will facilitate future research in this new problem space.

연구 동기 및 목표

  • 딥 러닝에서 교차 모달 오디오-비디오 생성에 대한 체계적인 연구 부족을 해결하기 위해.
  • 쌍체의 오디오-비디오 데이터를 사용하여 한 모달리티(오디오 또는 시각)에서 다른 모달리티를 생성하기 위해 조건부 GAN을 탐색하기 위해.
  • 오디오(로그-멜 스펙트로그램을 통한) 및 시각(CNN을 통한) 신호에 대한 효과적인 인코딩 및 디코딩 전략을 개발하기 위해.
  • 향후 오디오-비디오 생성 연구를 위해 두 가지 새로운 데이터셋—Sub-URMP 및 INIS—을 구성하고 공개하기 위해.
  • 자동 분류 및 인간 평가를 통한 생성 품질 평가를 위해.

제안 방법

  • 오디오에서 시각(S2I) 및 시각에서 오디오(I2S) 모달리티로의 매핑을 모델링하기 위해 조건부 GAN(cGANs)을 사용한다.
  • 이미지 및 오디오 표현 학습을 위해 CNN 기반 인코더와 디컨volutional 디코더를 활용한다.
  • 생성 품질 향상을 위해 원시 오디오를 로그-멜 스펙트로그램(LMS)으로 변환한다.
  • 실제 LMS에 대해 분류기를 훈련시어 생성된 스펙트로그램의 품질을 평가하며, 정확도를 품질의 Proxy로 사용한다.
  • 두 가지 별도의 생성 작업을 적용한다: 악기 중심(S2I-C) 및 자세 중심(S2I-P) 이미지 생성.
  • 양방향에서 실제 및 생성 샘플을 구분하기 위해 디스크림이너를 사용한 적대적 훈련을 수행한다.

실험 결과

연구 질문

  • RQ1조건부 GAN은 연주 오디오 신호에서 고품질의 시각적 이미지를 효과적으로 생성할 수 있는가?
  • RQ2모델은 연주하는 연주자의 시각적 이미지에서 현실적인 오디오 스펙트로그램을 생성할 수 있는가?
  • RQ3다양한 오디오 신호 표현 방식(예: 로그-멜 스펙트로그램 대비 원시 웨이브폼)은 생성 품질에 어떤 영향을 미치는가?
  • RQ4모델은 자세 수준의 생성에 얼마나 잘 일반화되는가? 즉, 연주에서 미세한 신체 동작을 포착할 수 있는가?
  • RQ5네트워크 아키텍처 및 손실 함수와 같은 설계 선택 사항은 생성된 오디오 및 시각 출력의 정밀도에 어떤 영향을 미치는가?

주요 결과

  • S2I-C 모델은 테스트 세트에서 분류기 기반 평가 정확도 75.56%를 달성하여, 생성된 이미지가 목표 악기 카테고리와 인지적으로 일치함을 시사한다.
  • I2S 모델은 실제 대 가짜 분류기에서 11.17%의 정확도를 기록하여, 낮은 정확도에도 불구하고 부분적으로 현실적인 스펙트로그램을 생성함을 나타낸다.
  • 모델은 한 개의 모델로도 다양한 자세를 성공적으로 생성하였으며, 그 결과는 그림 10에 나타나 있다.
  • 훈련 동역학 분석 결과, 디스크림이너의 성능이 약 50번째 에포크에 급격히 떨어졌으며, 이는 모드 붕괴 또는 훈련 불안정성을 시사하지만, 이후 복구가 이루어졌다.
  • 단 5개의 훈련 에포크 후에도 생성된 이미지가 높은 분류기 정확도(학습 세트 기준 87.37%)를 기록하여 의미 있는 시각적 특징을 빠르게 학습함을 보여준다.
  • 로그-멜 스펙트로그램은 다른 시간-주파수 변환 방식보다 생성에 가장 효과적인 오디오 표현 방식임이 밝혀졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.