Skip to main content
QUICK REVIEW

[논문 리뷰] Visual to Sound: Generating Natural Sound for Videos in the Wild

Yipin Zhou, Zhaowen Wang|arXiv (Cornell University)|2017. 12. 04.
Music and Audio Processing인용 수 5
한 줄 요약

이 논문은 제약 없는 실생활 환경에서 영상 프레임으로부터 자연스럽고 시간적으로 동기화된 오디오 웨이브폼을 학습 기반으로 생성하는 방법을 제안한다. 영상 인코더와 계층적 RNN 기반의 사운드 생성기로 구성된 모델은 인간이 신뢰할 수 있는 결과를 도출하였으며, 사용자 연구에서 생성된 사운드 중 70% 이상이 실제 사운드로 인식되어, 시각 입력에서 오디오 생성의 강력한 일반화 및 현실성 확보를 입증한다.

ABSTRACT

As two of the five traditional human senses (sight, hearing, taste, smell, and touch), vision and sound are basic sources through which humans understand the world. Often correlated during natural events, these two modalities combine to jointly affect human perception. In this paper, we pose the task of generating sound given visual input. Such capabilities could help enable applications in virtual reality (generating sound for virtual scenes automatically) or provide additional accessibility to images or videos for people with visual impairments. As a first step in this direction, we apply learning-based methods to generate raw waveform samples given input video frames. We evaluate our models on a dataset of videos containing a variety of sounds (such as ambient sounds and sounds from people/animals). Our experiments show that the generated sounds are fairly realistic and have good temporal synchronization with the visual inputs.

연구 동기 및 목표

  • 제약 없는 실생활 환경에서 영상 프레임으로부터 자연스럽고 원시적인 오디오 웨이브폼을 생성하는 방법을 개발하는 것.
  • 다양한 실생활 사운드(배경 소음, 인간 또는 동물 상호작용 포함)를 포함한 영상에서 시각-오디오 연관성 학습의 과제를 해결하는 것.
  • 훈련 및 평가를 지원하기 위해 10개의 사운드 카테고리에 걸쳐 총 28,109개의 영상(55시간)으로 구성된 고품질 정제된 데이터셋을 구축하는 것.
  • 정량적 지표와 인간 인식 연구를 통해 생성된 오디오의 현실성과 동기화 정도를 평가하는 것.
  • 최적의 오디오 생성 성능를 위한 다양한 시각 인코딩 아키텍처(프레임, 순차, 유동 기반)를 탐색하고 비교하는 것.

제안 방법

  • 모델은 영상 인코더를 거친 후 계층적 순환 신경망(RNN)을 사용해 단계적으로 원시 오디오 웨이브폼 샘플을 생성한다.
  • 세 가지 시각 인코딩 변형을 탐색: 프레임 수준 인코딩, 영상 프레임에 대해 RNN을 사용한 순차적 인코딩, 운동 동역학을 포착하기 위한 광학 유동 기반 인코딩.
  • 오디오 생성 네트워크는 원시 오디오 신호의 자기회귀적 생성을 위해 설계된 계층적 RNN 아키텍처인 SampleRNN 기반이다.
  • 2초 간격으로 영상과 오디오 콘텐츠가 시간적으로 정렬되고 관련성이 있는 것을 보장하기 위해 AudioSet의 일부를 정제하여 고유한 데이터셋을 구축하였다.
  • 훈련 과정은 원시 오디오로의 시각 입력 매핑을 위해 엔드 투 엔드 학습을 수행하며, 웨이브폼 정밀도와 시간적 정렬을 최적화한 손실 함수를 사용한다.
  • 평가에는 수치적 지표와 함께 참가자가 영상-오디오 쌍이 실제인지 생성된 것인지 판단하는 인간 연구가 포함된다.

실험 결과

연구 질문

  • RQ1딥러닝 모델은 제약 없는 실생활 환경에서 원시 영상 프레임으로부터 현실적이며 시간적으로 동기화된 오디오를 생성할 수 있는가?
  • RQ2다양한 시각 인코딩 전략(프레임, 순차, 광학 유동)은 생성된 오디오의 품질과 현실성에 어떤 영향을 미치는가?
  • RQ3생성된 오디오는 실제 오디오 또는 무작위 오디오 기반 모델 대비 인간 청취자에게 얼마나 현실적으로 인식되는가?
  • RQ4모델은 다수의 사운드 카테고리에 걸쳐 어떻게 일반화되는가? 다중 카테고리 생성에서의 한계는 무엇인가?
  • RQ5이전의 시각-오디오 생성 작업과 비교할 때, 오디오 품질과 동기화 측면에서 모델은 어떻게 성능을 내는가?

주요 결과

  • 제안된 모델은 생성된 오디오와 실제 오디오를 구분하는 인간 평가에서 73.36%의 정확도를 기록하였으며, 평균적으로 생성된 쌍의 73.36%가 실제 사운드로 인식되었다.
  • 유동 기반 시각 인코더가 프레임 및 순차 방법보다 우수했으며, 물이 흐르는 소리에 대해 81.25%의 현실성 평가를 기록했고 헬리콥터 소리에 대해선 78.13%를 기록했다.
  • 개와 드럼 카테고리에서 각각 64.32% 및 70.83%의 현실성 평가를 기록했으며, 이는 기준 모델(54.69% 및 59.64%)과 [15]에서 제시한 상한선 방법(40.16% 및 43.75%)보다 뚜렷이 뛰어났다.
  • 다중 카테고리 모델은 인간 인식 정확도 46.29%를 기록하여 카테고리 간 일반화 능력을 보였지만, 최고의 단일 카테고리 모델(73.63%)에 비해 아직 낮은 성능을 보였다.
  • Greatest Hits 데이터셋에서 경쟁력 있는 성능를 보였으며, 인간이 생성된 사운드를 실제 사운드보다 선호한 비율이 41.50%였고, 이는 [15]의 40.01% 결과와 유사했다.
  • 실제 오디오 기준은 평균 91.43%의 정확도로 정확히 식별되었으며, 이는 과제의 난이도와 인간 인식의 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.