Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Visually Aligned Sound from Videos

Peihao Chen, Yang Zhang|arXiv (Cornell University)|2020. 07. 14.
Speech and Audio Processing참고 문헌 42인용 수 4
한 줄 요약

이 논문은 시각적 요소와 일치하는 소리를 생성하기 위해, 훈련 중에 관련 소리 성분과 관련이 없는 성분을 분리하는 데 목적이 있는 오디오 프리패스 정규화 기법을 도입한 새로운 프레임워크인 RegNet을 제안한다. 봉쇄된 인코더를 통해 진짜 오디오 특징을 활용함으로써 RegNet은 시간적 및 콘텐츠 기반으로 일치하는 성능을 향상시켜, 생성된 소리에 대해 관찰자가 실재 여부를 판단하는 데 68.12%의 인간 성공률를 달성한다.

ABSTRACT

We focus on the task of generating sound from natural videos, and the sound should be both temporally and content-wise aligned with visual signals. This task is extremely challenging because some sounds generated \emph{outside} a camera can not be inferred from video content. The model may be forced to learn an incorrect mapping between visual content and these irrelevant sounds. To address this challenge, we propose a framework named REGNET. In this framework, we first extract appearance and motion features from video frames to better distinguish the object that emits sound from complex background information. We then introduce an innovative audio forwarding regularizer that directly considers the real sound as input and outputs bottlenecked sound features. Using both visual and bottlenecked sound features for sound prediction during training provides stronger supervision for the sound prediction. The audio forwarding regularizer can control the irrelevant sound component and thus prevent the model from learning an incorrect mapping between video frames and sound emitted by the object that is out of the screen. During testing, the audio forwarding regularizer is removed to ensure that REGNET can produce purely aligned sound only from visual features. Extensive evaluations based on Amazon Mechanical Turk demonstrate that our method significantly improves both temporal and content-wise alignment. Remarkably, our generated sound can fool the human with a 68.12% success rate. Code and pre-trained models are publicly available at https://github.com/PeihaoChen/regnet

연구 동기 및 목표

  • 영상의 시각적 콘텐츠와 시간적 및 콘텐츠 기반으로 일치하는 소리를 생성하는 데 도전하는 데 목적이 있다.
  • 영상 프레임에서 유추할 수 없는 시각적으로 관련 없는 소리로 인해 발생하는 정보 불일치 문제를 해결하는 데 목적이 있다.
  • 훈련 중에 관련 소리 성분을 분리하는 감독 메커니즘을 도입하여 정렬 성능을 향상시키는 데 목적이 있다.
  • 추론 시에 시각적 특징만을 기반으로 고음질의 현실적인 소리를 생성할 수 있도록 하는 데 목적이 있다.

제안 방법

  • RegNet은 시각적 동적 특징을 예측하기 위해 시간에 따라 변화하는 외관 및 운동 특징 추출 모듈을 사용한다.
  • 오디오 프리패스 정규화 기법은 진짜 오디오를 봉쇄된 특징으로 인코딩하고, 이를 훈련 중에 시각적 특징과 융합한다.
  • 정규화 기법은 생성자 모델이 시각적 특징과 오디오 봉쇄 특징을 모두 활용해 진짜 오디오를 재구성할 수 있도록 강력한 감독을 제공한다.
  • 추론 시에는 오디오 프리패스 정규화 기법을 제거하여 소리 생성이 오직 시각적 특징에 의존하도록 한다.
  • 모델은 스펙트로그램 재구성에 대한 L2 손실과 판별자에 의한 적대적 손실을 사용하여 훈련되며, 이는 오디오의 정밀도를 향상시킨다.
  • RegNet의 다양한 변형은 다운샘플링 비율 S와 출력 차원 D를 제어하여 정규화 기법의 용량이 성능에 미치는 영향을 연구하기 위해 평가된다.

실험 결과

연구 질문

  • RQ1비디오 소리 생성에서 시간적 및 콘텐츠 기반 정렬이 음성 합성에 비해 특히 어려운 이유는 무엇인가?
  • RQ2훈련 데이터에 존재하는 시각적으로 관련 없는 소리의 영향으로 기존 모델의 정렬 성능이 어떻게 악화되는가?
  • RQ3오디오 프리패스 정규화 기법이 비관련 소리 성분을 효과적으로 억제하고 훈련 중 정렬 성능을 향상시킬 수 있는가?
  • RQ4오디오 프리패스 정규화 기법의 용량이 모델이 올바른 시각-소리 매핑을 학습하는 데 미치는 영향은 무엇인가?
  • RQ5적대적 훈련이 RegNet 아키텍처에서 생성된 소리의 청각적 품질과 현실성 향상에 기여하는가?

주요 결과

  • RegNet은 '진짜인지 가짜인지' 테스트에서 관찰자가 속일 수 있는 데 68.12%의 인간 성공률를 기록하여 기준 모델들을 능가한다.
  • 최적의 RegNet 변형(S860D32)은 Dog-gauss 데이터에서 가장 낮은 L2 거리(1.96)를 기록하여 좁은(D8) 및 넓은(D1024) 변형보다 뛰어난 성능을 보였다.
  • 넓은 변형(S860D1024)은 소리 누락(Sound-Missing) 점수에서 열악한 성능을 보이며, 정규화 기법에 과도하게 의존함으로써 행동 이벤트 동안 소리를 생성하지 못하는 것으로 나타났다.
  • 좁은 변형(S860D8)은 노이즈가 많은 스펙트로그램을 생성하여 정규화 기법에서 제공하는 정보가 부족해 잘못된 매핑을 학습한 것으로 나타났다.
  • 적대적 판별자를 제거하면 인간 성공률가 64.04%로 감소하여, 이는 적대적 훈련이 오디오 정밀도 향상에 기여한다는 것을 보여준다.
  • 주관적 평가 결과, RegNet은 모든 세 가지 정렬 지표(Sound-Missing, Sound-Redundant, Sound-Mismatched)에서 평균 평가 점수에서 가장 높은 점수를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.