Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Pitch-Shifting and Time-Stretching with Controllable LPCNet

Max Morrison, Zeyu Jin|arXiv (Cornell University)|2021. 10. 05.
Speech and Audio Processing참고 문헌 26인용 수 14
한 줄 요약

이 논문은 LPCNet의 피치 표현을 향상시키고 음색 특징과 피치를 분리하며 훈련 데이터를 확장하여 고음질, 제어 가능한 음정 이동 및 시간 스트레칭 기능을 제공하는 개선된 신경 음성합성기인 Controllable LPCNet (CLPCNet)을 제안한다. CLPCNet는 이전의 신경 및 DSP 기반 방법보다 우수한 객관적 및 주관적 성능을 달성하며, 음정 이동과 시간 스트레칭에서 품질을 유지하거나 초월하면서도 동시에 음성 코딩과 조작을 가능하게 한다.

ABSTRACT

Modifying the pitch and timing of an audio signal are fundamental audio editing operations with applications in speech manipulation, audio-visual synchronization, and singing voice editing and synthesis. Thus far, methods for pitch-shifting and time-stretching that use digital signal processing (DSP) have been favored over deep learning approaches due to their speed and relatively higher quality. However, even existing DSP-based methods for pitch-shifting and time-stretching induce artifacts that degrade audio quality. In this paper, we propose Controllable LPCNet (CLPCNet), an improved LPCNet vocoder capable of pitch-shifting and time-stretching of speech. For objective evaluation, we show that CLPCNet performs pitch-shifting of speech on unseen datasets with high accuracy relative to prior neural methods. For subjective evaluation, we demonstrate that the quality and naturalness of pitch-shifting and time-stretching with CLPCNet on unseen datasets meets or exceeds competitive neural- or DSP-based approaches.

연구 동기 및 목표

  • 기존의 신경 및 DSP 기반 방법이 음정 이동 및 시간 스트레칭에서 잡음이나 음색의 열화를 유발하는 등의 한계를 해결하기 위해.
  • LPCNet의 음정 이동 성능을 향상시키기 위해 세 가지 핵심 문제를 해결하기 위해: 열악한 피치 표현, 피치와 음색 특징 간의 충분한 분리 부족, 극단적인 음정 범위에 대한 훈련 데이터 부족.
  • 일정 비율과 가변 비율의 음정 이동 및 시간 스트레칭을 모두 높은 정밀도로 구현하여 미리 보지 않은 화자와 데이터셋에서도 성능을 유지하기 위해.
  • 실시간 상호작용 편집을 지원하는 단일 통합 프레임워크에서 고음질 음성 합성과 제어 가능한 음성 조작을 동시에 달성하기 위해.
  • 신경 기반 방법이 TD-PSOLA 및 WORLD와 같은 기존의 DSP 도구에 비해 청취 품질 면에서 동등하거나 이를 초월할 수 있음을 입증하기 위해.

제안 방법

  • 피치 표현을 더욱 견고하게 하고 음색 특징과 피치를 명시적으로 분리함으로써 제어성 향상과 잡음 감소를 도모하기 위해 LPCNet을 개선한다.
  • 극단적인 음정 범위(매우 높거나 낮은 음정)를 포함한 훈련 데이터를 확장하여 다양한 화자와 음정 변화에 대한 일반화 능력을 향상시킨다.
  • 자기회귀적 생성 과정에서 자극 신호를 모델링하기 위해 샘플레이트 네트워크의 GRU 레이어에 희소성 제약을 제거한다.
  • 성능을 떨어뜨리는 데이터 증강 기법을 피하는 수정된 훈련 파이프라인을 도입하여 안정성과 정확도를 향상시킨다.
  • 이중 브랜치 네트워크 아키텍처를 사용한다: 프레임레이트 네트워크는 피치, 주기성, BFCC를 처리하고, 샘플레이트 네트워크는 mu-law 인코딩된 자극 신호를 자기회귀적으로 생성한다.
  • 소스-필터 분해를 적용하여 잔여 신호(피치 및 노이즈)와 스펙트럼(음색) 성분을 별도로 모델링함으로써 정밀한 음정 및 지속시간 조작을 가능하게 한다.

실험 결과

연구 질문

  • RQ1LPCNet와 같은 신경 음성합성기의 경우 음질을 희생시키지 않고도 정확하고 자연스러운 음정 이동 및 시간 스트레칭을 효과적으로 적용할 수 있는가?
  • RQ2피치 표현, 특징 분리, 훈련 데이터 분포는 신경 음성 조작의 성능에 어떤 영향을 미치는가?
  • RQ3CLPCNet는 TD-PSOLA 및 WORLD와 같은 기존의 DSP 기반 방법보다 객관적 지표와 주관적 청취 테스트 모두에서 음정 이동 및 시간 스트레칭 성능에서 승리하는가?
  • RQ4CLPCNet는 높은 정밀도를 유지하면서도 새로운 화자와 데이터셋에 일반화되어 가변 비율 음성 조작 작업을 수행할 수 있는가?
  • RQ5단일 신경 음성합성기로 고음질 음성 코딩과 제어 가능한 음성 조작을 동시에 얼마나 잘 수행할 수 있는가?

주요 결과

  • RAVDESS 데이터셋에서 미리 보지 않은 화자에 대해 CLPCNet는 일정 비율 음정 이동(비율 1.00)에서 평균 F1 스코어 0.945를 기록하여 LPCNet(F1 = 0.791)을 크게 앞서며 이전의 신경 기반 방법과 동등하거나 슈퍼어리어를 기록한다.
  • 객관적 지표에서 CLPCNet는 1.00 음정 비율에서 루트 평균 제곱 오차(RMS error)를 21.6으로 줄였고, GPE는 0.040으로 감소시켰다. 이는 LPCNet의 79.5 및 0.101 대비 상당한 향상임을 시사한다.
  • 주관적 MOS 테스트에서 CLPCNet는 모든 조건에서 LPCNet를 능가하며, 대부분의 음정 이동 및 시간 스트레칭 비율에서 자연스러움과 품질 면에서 WORLD 및 TD-PSOLA를 따라하거나 능가한다.
  • 가변 비율 음정 이동에서 CLPCNet는 MOS 4.25를 기록하여 이전의 신경 기반 방법을 크게 능가하며 원본 녹음 품질에 가까워졌다.
  • 제거 실험 결과, 희소성 제약 제거 및 데이터 증강 기법 제거 시 F1 스코어가 DAPS에서 0.779에서 0.945로 상승하여 모든 개선 사항을 적용했을 때 성능 향상이 뚜렷하게 나타났다.
  • CLPCNet는 새로운 화자와 데이터셋에 대해 뛰어난 일반화 능력을 보이며, VCTK(보기 및 보지 않은 화자 포함)와 RAVDESS에서 일관된 성능을 기록했고, 보지 않은 데이터에서 1.00 비율일 경우 RMS 오차가 20.0 이하로 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.