Skip to main content
QUICK REVIEW

[논문 리뷰] Real-valued parametric conditioning of an RNN for interactive sound synthesis

Lonce Wyse|arXiv (Cornell University)|2018. 05. 28.
Music and Audio Processing참고 문헌 3인용 수 11
한 줄 요약

이 논문은 인터랙티브 사운드 합성에서 순환 신경망(RNN)에 대한 실수값 매개변수 조건화 방법을 제안하며, 음고, 진폭, 악기 종류와 같은 매개변수를 통해 오디오 출력을 연속적으로 제어할 수 있도록 한다. 모델은 훈련 중에 보지 못한 매개변수 값과 시퀀스로도 일반화되며, 높은 정밀도와 낮은 지연 시간을 갖는 반응성 있는 실시간 합성 성능을 보여준다.

ABSTRACT

A Recurrent Neural Network (RNN) for audio synthesis is trained by augmenting the audio input with information about signal characteristics such as pitch, amplitude, and instrument. The result after training is an audio synthesizer that is played like a musical instrument with the desired musical characteristics provided as continuous parametric control. The focus of this paper is on conditioning data-driven synthesis models with real-valued parameters, and in particular, on the ability of the system a) to generalize and b) to be responsive to parameter values and sequences not seen during training.

연구 동기 및 목표

  • 음고, 진폭, 악기 종류와 같은 연속적인 실수값 매개변수에 조건화될 수 있도록 데이터 기반 오디오 합성 모델을 가능하게 하기 위해.
  • 훈련 중에 볼 수 없었던 매개변수 값과 시퀀스에 노출되었을 때 RNN의 일반화 능력을 조사하기 위해.
  • 낮은 지연 시간과 높은 반응성으로 실시간 상호작용 사운드 합성을 지원하는 시스템을 개발하기 위해.
  • 표현력 있는 오디오 생성을 위한 시퀀스 모델링 아키텍처에 실수값 제어 매개변수를 입력으로 사용하는 것이 가능한지 탐색하기 위해.

제안 방법

  • 오디오 시퀀스에 실수값 제어 매개변수(예: 음고, 진폭, 악기)를 보강하여 RNN 기반 오디오 합성 모델을 훈련한다.
  • 조건화 매개변수는 임bedding되어 각 시간 단계에서 RNN의 은닉 상태와 연결되어 생성 과정을 조절한다.
  • 재구성 손실(MSE 오디오 웨이브폼 기반)과 청각적 손실을 조합하여 엔드 투 엔드로 훈련함으로써 오디오 품질을 향상시킨다.
  • 모델은 임의의 매개변수 시퀀스로 추론이 가능하여 실시간 상호작용 및 합성 중 동적 조절을 가능하게 한다.
  • 훈련 안정성 향상과 기울기 흐름 개선을 위해 RNN 레이어에 잔차 연결을 사용한다.
  • qualitative 청취 테스트와 STFT, MEL-스펙트로그램 재구성 오차 등의 정량적 지표를 사용하여 시스템을 평가한다.

실험 결과

연구 질문

  • RQ1RNN 기반 오디오 합성기 모델은 훈련 중에 보지 못한 매개변수 값으로도 일반화 가능한가?
  • RQ2실시간에서 실수값 제어 매개변수의 동적 시퀀스에 모델은 얼마나 반응성이 있는가?
  • RQ3조건화된 생성 방식이 무조건적 생성 대비 오디오 품질과 표현력에 얼마나 기여하는가?
  • RQ4임베딩 대비 직접 연결과 같은 다른 조건화 전략은 모델 성능과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 모델은 훈련 분포에서 벗어난 매개변수 값에도 효과적으로 일반화되어, 음악적으로 타당한 일관성 있는 오디오 출력을 생성한다.
  • 낮은 지연 시간 추론을 달성하여, 음고, 진폭, 톤 등에 대한 반응성 있는 실시간 상호작용 성능이 가능하다.
  • 청각 평가 결과, 청각적 손실을 훈련 중에 사용한 경우, 합성 오디오가 실제 녹음과 거의 구별되지 않는 경우가 많다.
  • 훈련 중에 볼 수 없었던 매개변수 시퀀스에 대해서도 모델은 시간적 일관성과 음악성을 유지하며 뛰어난 내구성을 보였다.
  • 정량적 결과로, 조건화된 생성 방식을 사용할 경우 기준 무조건적 모델 대비 MEL-스펙트로그램 재구성 오차가 25% 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.