Skip to main content
QUICK REVIEW

[논문 리뷰] Streamable Neural Audio Synthesis With Non-Causal Convolutions

Antoine Caillon, Philippe Esling|arXiv (Cornell University)|2022. 04. 14.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 기존의 비인과적 컨볼루션 신경망을 재학습 없이 실시간 오디오 처리에 적합한 스트리밍 모델로 전환할 수 있도록 내부 지연을 도입하는 후기 훈련 방법을 제안한다. 이 방법을 통해 재학습 없이도 고품질의 저지연 오디오 합성 구현이 가능하며, 오버lap-add 방법보다 뛰어난 속도를 확보한다. RAVE와 같은 기존 모델을 재학습 없이도 실시간 호환 시스템으로 변환할 수 있으며, 품질 손실 없이도 뛰어난 성능을 발휘한다.

ABSTRACT

Deep learning models are mostly used in an offline inference fashion. However, this strongly limits the use of these models inside audio generation setups, as most creative workflows are based on real-time digital signal processing. Although approaches based on recurrent networks can be naturally adapted to this buffer-based computation, the use of convolutions still poses some serious challenges. To tackle this issue, the use of causal streaming convolutions have been proposed. However, this requires specific complexified training and can impact the resulting audio quality. In this paper, we introduce a new method allowing to produce non-causal streaming models. This allows to make any convolutional model compatible with real-time buffer-based processing. As our method is based on a post-training reconfiguration of the model, we show that it is able to transform models trained without causal constraints into a streaming model. We show how our method can be adapted to fit complex architectures with parallel branches. To evaluate our method, we apply it on the recent RAVE model, which provides high-quality real-time audio synthesis. We test our approach on multiple music and speech datasets and show that it is faster than overlap-add methods, while having no impact on the generation quality. Finally, we introduce two open-source implementation of our work as Max/MSP and PureData externals, and as a VST audio plugin. This allows to endow traditional digital audio workstation with real-time neural audio synthesis on a laptop CPU.

연구 동기 및 목표

  • 원래 스트리밍을 위해 설계되지 않은 사전 훈련된 컨볼루션 신경망을 사용해 실시간 신경 오디오 합성을 가능하게 한다.
  • 재학습 없이도 비인과적 컨볼루션의 버퍼 기반 처리에서 발생하는 위상 불연속 문제를 해결하면서 부가적인 계산을 유발하지 않는다.
  • 디지털 오디오 워크스테이션에서 저지연 추론을 가능하게 하면서도 오디오 품질과 모델 정확도를 유지한다.
  • 실시간 신경 오디오 합성을 창작 오디오 워크플로우에 통합할 수 있는 실용적이고 오픈소스 도구( Max/MSP, PureData, VST)를 제공한다.
  • 다양한 오디오 데이터셋(음악 및 발화 포함)에서 최소한의 지연과 높은 속도로 본 방법의 효과성을 입증한다.

제안 방법

  • 기존의 비인과적 컨볼루션 신경망의 계산 그래프를 그대로 유지하면서 추론 후 내부 지연을 도입해 인과적 스트리밍 버전으로 재구성한다.
  • 내부 상태를 캐시하여 오디오 버퍼 경계를 넘어서도 시간적 연속성을 유지하고, 패딩 대신 상태 전파를 활용한다.
  • 모델의 재학습이나 아키텍처 변경 없이도 후기 훈련 단계에서만 적용 가능한 방법이다.
  • 모든 지연 경로를 정확히 제어하여 병렬 브랜치를 가진 복잡한 아키텍처에서도 지연 전파를 안정적으로 관리한다.
  • 라이브러리 형태로 구현하여 Max/MSP와 PureData에는 커스텀 외부 모듈을, VST3 플러그인은 JUCE 프레임워크를 사용해 통합한다.
  • 최근접 이웃 보간을 통해 잠재 표현을 오디오 신호로 변환하고, 그래픽 인터페이스를 통해 사용자가 실시간으로 잠재 차원의 스케일링, 바이어스, 노이즈를 조절할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1재학습 없이도 비인과적 컨볼루션 모델을 재학습 없이 스트리밍 가능하게 만들 수 있는가?
  • RQ2내부 지연을 어떻게 도입하여 실시간 버퍼 기반 처리를 가능하게 하면서도 모델 정확도를 유지할 수 있는가?
  • RQ3오버랩-애드 방법 대비 본 방법이 얼마나 지연을 줄이고 추론 속도를 향상시키는가?
  • RQ4본 방법이 병렬 브랜치를 가진 복잡한 아키텍처와 다양한 오디오 생성 작업에 일반화 가능한가?
  • RQ5실시간 사용자 상호작용이 가능한 실무 창작 오디오 환경(DAW 등)에서 본 방법의 효과성은 어떠한가?

주요 결과

  • 제안된 방법은 오버랩-애드 방법보다 빠른 추론 속도를 확보하면서도 원본 비인과적 모델과 동일한 오디오 품질을 유지한다.
  • 오픈소스 Max/MSP 및 PureData 외부 모듈을 통해 표준 랩탑 CPU에서도 실시간 오디오 합성을 구현할 수 있다.
  • VST3 플러그인 구현은 사용자가 정의한 스케일링, 바이어스, 노이즈를 각 차원별로 조절할 수 있는 잠재 표현의 실시간 조작을 지원한다.
  • RAVE 모델을 품질 저하 없이 스트리밍 가능한 시스템으로 성공적으로 변환하였으며, 음악 및 발화 데이터셋을 포함한 다양한 오디오 데이터셋에서 검증되었다.
  • 내부 지연 관리에 신중함을 기울여 병렬 브랜치를 포함한 복잡한 아키텍처와도 호환 가능하다.
  • 오픈소스 라이브러리 및 플러그인을 통해 전통적인 디지털 오디오 워크스테이션에 신경 오디오 합성을 원활하게 통합할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.