Skip to main content
QUICK REVIEW

[논문 리뷰] Learning robust speech representation with an articulatory-regularized variational autoencoder

Marc-Antoine Georges, Laurent Girin|arXiv (Cornell University)|2021. 04. 07.
Speech Recognition and Synthesis참고 문헌 34인용 수 4
한 줄 요약

이 논문은 EMA 데이터에서 유도된 운동자지표 궤적을 따르도록 잠재 공간의 일부를 제약하는 예술적 정규화된 변동형 오토인코더(AR-VAE)를 제안한다. 이 방법은 전통적인 VAE에 비해 학습 수렴 속도를 빠르게 하고 재구성 오차를 감소시키며, 음성 노이즈 제거 성능을 향상시킨다. 운동자지표 사전 지식을 통합함으로써 더 강건하고 효율적인 음성 표현 학습이 가능하다는 점을 입증한다.

ABSTRACT

It is increasingly considered that human speech perception and production both rely on articulatory representations. In this paper, we investigate whether this type of representation could improve the performances of a deep generative model (here a variational autoencoder) trained to encode and decode acoustic speech features. First we develop an articulatory model able to associate articulatory parameters describing the jaw, tongue, lips and velum configurations with vocal tract shapes and spectral features. Then we incorporate these articulatory parameters into a variational autoencoder applied on spectral features by using a regularization technique that constraints part of the latent space to follow articulatory trajectories. We show that this articulatory constraint improves model training by decreasing time to convergence and reconstruction loss at convergence, and yields better performance in a speech denoising task.

연구 동기 및 목표

  • 변동형 오토인코더에서 깊이 있는 음성 표현 학습을 가속화하고 향상시키기 위해 사전 운동자지표 지식이 가능한지 조사한다.
  • 운동자지표 제약 조건이 노이즈가 있는 조건에서 학습된 표현의 강건성에 기여하는지 평가한다.
  • 생리적 음성 생성 지식을 잠재 공간 학습에 통합하는 공동 운동자지표-음향 모델링 프레임워크를 개발한다.
  • 운동자지표 정규화가 음성 재구성 품질과 노이즈 제거 성능에 미치는 영향을 평가한다.

제안 방법

  • 두 명의 기준 화자로부터의 EMA 데이터(턱, 혀, 입술, 연조직)를 기반으로 운동자지표 모델을 학습하여 운동자지표 파라미터를 후각 트랙트 형태와 스펙트럼 특징으로 매핑한다.
  • 음성 오디오에서 추출한 스펙트럼 특징(18개의 베어크 척도 서큘러스 계수)을 기반으로 변동형 오토인코더(VAE)를 학습한다.
  • 잠재 공간의 일부를 학습된 운동자지표 궤적을 따르도록 제약하기 위해 VAE 손실 함수에 정규화 항을 도입한다. 이는 운동자지표 역학과의 일치를 강제한다.
  • 정규화는 잠재 코드와 예측된 운동자지표 파라미터 간의 가중 재구성 오차를 사용하며, 초수치 α가 제약 강도를 조절한다.
  • 기본 모델로 전통적인 VAE를 사용하여 학습 수렴 속도와 재구성 오차를 모니터링한다.
  • 다양한 SNR 수준에서 HMM 기반 음소 디코딩 정확도와 MUSHRA 주관적 품질 점수를 통해 음성 노이즈 제거 성능을 평가한다.

실험 결과

연구 질문

  • RQ1사전 운동자지표 지식이 음성 표현 학습을 위한 VAE 학습 과정을 가속화할 수 있는가?
  • RQ2운동자지표 제약 조건을 통합함으로써 노이즈가 있는 음성 조건에서 학습된 표현의 강건성이 향상되는가?
  • RQ3재구성 품질과 수렴 속도 측면에서 AR-VAE는 전통적인 VAE와 어떻게 비교되는가?
  • RQ4운동자지표 정규화는 노이즈 제거 작업에서 재구성된 음성 신호의 청취 품질을 향상시킬 수 있는가?

주요 결과

  • AR-VAE는 전통적인 VAE에 비해 더 빠른 수렴 속도와 더 낮은 재구성 오차를 기록했으며, 학습 시간이 크게 감소했다.
  • 0 dB SNR에서 음성 노이즈 제거 작업에서 AR-VAE는 음소 디코딩 정확도를 12.5%p 향상시켰다(78.3%에서 90.8%로, p < 0.001).
  • MUSHRA 점수는 정제된 음성과 SNR = 10 dB에서 통계적으로 유의미한 향상(p < 0.001)을 보였지만, SNR = 5 dB와 0 dB에서는 유의미한 차이가 없었다.
  • AR-VAE는 특히 형태성 전이와 운동자지표 역학을 유지하는 데 있어 더 높은 스펙트럼 재구성 정밀도를 보였다.
  • α = 1일 때 정규화가 가장 우수한 성능을 보였으며, 이는 음향과 운동자지표 제약 간 최적의 균형을 의미한다.
  • 결과는 운동자지표 사전 지식이 잠재 공간 내 학습된 음성 표현의 분리성과 해석 가능성 향상에 기여한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.