Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Synthesis of Footsteps Sound Effects with Generative Adversarial Networks

Marco Comunità, Huy Phan|arXiv (Cornell University)|2021. 10. 18.
Music and Audio Processing참고 문헌 34인용 수 6
한 줄 요약

이 논문은 신경 음향 합성에 생성적 적대적 네트워크(GANs)를 처음으로 적용한 것으로, 하이브리드 WaveGAN 생성자와 HiFi-GAN 판별자 조합을 사용하여 발자국 소리 효과를 합성한다. 이 방법은 주관적 听음 테스트에서 실제 기록과 유사한 현실감 점수를 달성하며, 전통적인 절차적 및 스펙트럼 모델링 방법보다 뛰어난 성능을 보였다.

ABSTRACT

Footsteps are among the most ubiquitous sound effects in multimedia applications. There is substantial research into understanding the acoustic features and developing synthesis models for footstep sound effects. In this paper, we present a first attempt at adopting neural synthesis for this task. We implemented two GAN-based architectures and compared the results with real recordings as well as six traditional sound synthesis methods. Our architectures reached realism scores as high as recorded samples, showing encouraging results for the task at hand.

연구 동기 및 목표

  • 딥 생성 모델, 특히 GAN을 사용하여 전통적인 절차적 또는 샘플링된 오디오 방법의 대안으로 발자국 소리 효과의 신경 합성을 탐색하는 것.
  • GAN 기반 모델이 실제 세계 기록과 동등한 청각적 현실감을 가진 발자국 소리 효과를 생성할 수 있는지 평가하는 것.
  • 통제된 听음 테스트에서 신경 합성 모델의 성능을 여섯 가지 기존의 전통적 합성 방법과 비교하는 것.
  • 업샘플링 방법과 판별자 설계와 같은 GAN의 아키텍처 선택 사항이 음성 품질 향상과 데이터 분포 근사에 미치는 영향을 조사하는 것.
  • 특히 인간 청각 맥락에서 음성 품질과 청각적 현실감 간의 역할을 평가하는 것.

제안 방법

  • Zapsplat에서 수집한 81개의 고품질 발자국 기록(16kHz, -6dBFS)으로 구성된 맞춤형 데이터셋을 구축하였으며, 카펫, 딜, 금속, 아스팔트, 러그, 나무, 나무 내부 7종의 표면에서 하이힐을 신은 경우를 포함한다.
  • 생성자는 조건부 WaveGAN 아키텍처를 사용하며, 5개의 역전치 1D 컨볼루션 레이어, 배치 정규화, 잠재 노이즈 입력을 포함하고, 제로 스태핑 또는 보간을 통해 8192개 샘플(~0.5초)로 업샘플링한다.
  • 하이브리드 판별자는 조건부 WaveGAN 판별자와 HiFi-GAN의 다중 해상도 아키텍처를 조합하여 현실감 향상과 데이터 분포 근사 개선에 기여한다.
  • 표준 조건부 WaveGAN과 하이브리드 WaveGAN-HiFi-GAN 모델 두 가지 아키텍처를 훈련하였으며, 둘 다 표면 종류와 신발 종류에 따라 조건부로 설정되었다.
  • 목적적 지표(예: FID)와 19명의 경험이 풍부한 오디오 전문가를 대상으로 한 주관적 听음 테스트를 통해 모델을 평가하였다.
  • 오디오 샘플은 8192개 샘플(0.5초)로 합성되었으며, 일정한 보폭을 유지하여 여러 샘플을 연결함으로써 10초 분량의 걷기 효과를 시뮬레이션하였다.

실험 결과

연구 질문

  • RQ1GAN 기반 신경 합성은 실제 기록과 유사한 청각적 현실감을 지닌 발자국 소리 효과를 생성할 수 있는가?
  • RQ2하이브리드 WaveGAN-HiFi-GAN 아키텍처는 표준 WaveGAN 및 전통적인 절차적 합성 방법에 비해 음성 품질과 현실감 측면에서 어떻게 비교되는가?
  • RQ3음성 품질이 발자국 소리 효과의 청각적 현실감과 얼마나 관련이 깊은가?
  • RQ4업샘플링 방법이나 판별자 설계와 같은 아키텍처 선택 사항 중에서 합성된 발자국의 현실감에 가장 큰 영향을 미치는 요소는 무엇인가?
  • RQ5신경 합성 모델은 실시간 합성 가능성을 유지하면서도 비디오 게임과 같은 애플리케이션에서 최신 기술 수준의 현실감을 달성할 수 있는가?

주요 결과

  • 하이브리드 WaveGAN-HiFi-GAN 모델은 주관적 听음 테스트에서 실제 기록과 통계적으로 구분되지 않는 현실감 점수를 기록하였으며, 모든 전통적 합성 방법보다 뛰어난 성능을 보였다.
  • WaveGAN 및 HiFi-WaveGAN 모델 모두 실제 기록과 동일한 평균 현실감 평가 점수를 획득하여 강력한 청각적 정밀도를 보였다.
  • WaveGAN 모델은 뚜렷한 배경 노이즈와 왜곡을 보였지만, HiFi-WaveGAN 모델은 더 깔끔하고 자연스러운 출력을 생성하여 음성 품질 향상을 시사했다.
  • 제로 스태핑이 최근접 이웃, 선형, 큐빅 보간보다 청각적 품질 측면에서 뛰어나다는 점에서, GAN 문헌에서 일반적으로 가정되는 바와는 반대로 결과가 나왔다.
  • Farnell의 절차적 모델 및 통계적 모델링과 같은 전통적 방법은 유의미하게 낮은 점수를 기록하여, 비신경 기반 접근 방식이 복잡하고 광대역의 충격성 음향에 한계를 가짐을 시사했다.
  • 결과적으로 음성 품질 자체만으로는 청각적 현실감을 완전히 결정하지 못하며, 스펙트럼 은하와 순순성 특성과 같은 다른 청각적 요소가 인간 판단에 결정적인 역할을 한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.