Skip to main content
QUICK REVIEW

[논문 리뷰] Audio Data Augmentation for Acoustic-to-articulatory Speech Inversion using Bidirectional Gated RNNs

Yashish M. Siriwardena, Ahmed Adel Attia|arXiv (Cornell University)|2022. 05. 25.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 멜주파수 cepstral 계수(MFCCs)를 입력으로 사용하고 6개의 음성통 변수(TVs)를 출력으로 내보내는 청각-음성어휘 음성 역전파를 위한 이방향 게이팅 순환 신경망(BiGRNN)을 제안한다. 음성 데이터 증강, 특히 배경 소음과 음악을 사용할 경우, 청소된 음성과 노이즈가 섞인 음성 모두에서 성능 향상이 이루어지며, 이는 이전의 노이즈에 강건한 기준 모델 대비 상대적 5% 향상(0.7959 PPMC)을 달성하고, 추가로 6%의 성능 향상이 가능한 말하기자체 적응을 통해 이루어진다.

ABSTRACT

Data augmentation has proven to be a promising prospect in improving the performance of deep learning models by adding variability to training data. In previous work with developing a noise robust acoustic-to-articulatory speech inversion system, we have shown the importance of noise augmentation to improve the performance of speech inversion in noisy speech. In this work, we compare and contrast different ways of doing data augmentation and show how this technique improves the performance of articulatory speech inversion not only on noisy speech, but also on clean speech data. We also propose a Bidirectional Gated Recurrent Neural Network as the speech inversion system instead of the previously used feed forward neural network. The inversion system uses mel-frequency cepstral coefficients (MFCCs) as the input acoustic features and six vocal tract-variables (TVs) as the output articulatory features. The Performance of the system was measured by computing the correlation between estimated and actual TVs on the U. Wisc. X-ray Microbeam database. The proposed speech inversion system shows a 5% relative improvement in correlation over the baseline noise robust system for clean speech data. The pre-trained model, when adapted to each unseen speaker in the test set, improves the average correlation by another 6%.

연구 동기 및 목표

  • 청소된 음성과 노이즈가 섞인 음성 데이터에서 데이터 증강을 통해 청각-음성어휘 음성 역전파(SI) 시스템의 성능을 향상시키는 것.
  • 이전의 순방향 신경망을 더 나은 시간 동적 특성을 모델링할 수 있는 더 맥락 인식 가능한 BiGRNN 아키텍처로 대체하여 음성운동의 시간적 특성을 더 잘 모델링하는 것.
  • 데이터 증강이 일반화 능력을 향상시키는지 평가하여, 특히 알려지지 않은 말하기자체에 대해 청소된 데이터에서의 강건성과 성능 향상을 향상시키는지 확인하는 것.
  • 개별 말하기자체 데이터로 미리 훈련된 모델을 미세조정하여 말하기자체 적응의 효과를 조사하는 것.
  • XRMB 데이터셋에서의 SI 성능 측면에서 제안된 BiGRNN 모델을 BiLSTM 및 CNN-BiLSTM와 같은 기존 아키텍처와 비교하는 것.

제안 방법

  • MFCC 특징의 순차적 의존성을 모델링하고 6개의 음성통 변수(TVs)를 예측하기 위해 이방향 게이팅 순환 신경망(BiGRNN)을 사용하였다.
  • 세 가지 데이터 증강 기법을 적용: 시간 왜곡, 추가적 노이즈, 음악 배경 증강이며, 후자가 가장 우수한 성능을 보였다.
  • 청소된 음성과 증강된 데이터를 모두 사용하여 BiGRNN 모델을 훈련시켜 다양한 음성 조건에서의 강건성과 일반화 능력을 향상시켰다.
  • 말하기자체 적응을 위해 사전 훈련된 BiGRNN 모델을 기초로 삼아, 각 알려지지 않은 말하기자체의 소량의 데이터로 미세조정하였다.
  • 제한된 데이터에서의 훈련 안정성을 확보하기 위해 조기 정지와 학습률 스케줄링을 적용하였으며, 초기 학습률을 낮추고 배치 크기를 작게 설정하였다.
  • Wisconsin X-ray 마이크로빔(XRMB) 데이터베이스에서 추정된 TV와 실제 TV 간 피어슨 제품모멘트 상관계수(PPMC)를 사용하여 모델 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1음성 데이터 증강이 노이즈가 섞인 음성 뿐 아니라 청소된 음성 데이터에서도 음성 역전파 모델의 성능 향상에 기여하는가?
  • RQ2BiGRNN 아키텍처가 이전의 순방향 신경망보다 청각 특징에서 음성운동 궤적을 예측하는 데 더 우수한 성능을 보이는가?
  • RQ3제한된 대상 말하기자체 데이터로 미세조정된 사전 훈련된 BiGRNN 모델이 얼마나 향상될 수 있는가?
  • RQ4시간 왜곡, 추가적 노이즈, 음악 배경 중 어느 데이터 증강 전략이 가장 강건하고 정확한 SI 모델을 만들어내는가?
  • RQ5제안된 BiGRNN 모델의 성능은 BiLSTM 및 CNN-BiLSTM와 같은 기존 아키텍처와 비교해 TV 예측 정확도 측면에서 어떻게 다른가?

주요 결과

  • 제안된 BiGRNN 모델은 청소된 음성 데이터에서 이전의 노이즈에 강건한 기준 모델 대비 평균 PPMC(0.7959)에서 상대적 5% 향상된 성능을 달성하였으며, 이는 데이터 증강이 청소된 조건에서도 성능 향상에 기여함을 보여준다.
  • 가장 우수한 성능을 보인 모델은 배경 음악과 노이즈를 사용한 음성 데이터 증강을 통해 훈련된 것으로, 다양한 음성 조건에서의 일반화 능력 향상에 기여하였다.
  • 말하기자체 적응 후 평균 PPMC 점수는 사전 훈련된 모델의 0.7942에서 말하기자체 적응 모델의 0.8506으로 상승하여, 알려지지 않은 말하기자체에 대해 상당한 성능 향상을 보였다.
  • JW31와 같은 개별 말하기자체의 경우, 말하기자체 적응 모델이 PPMC 0.9106을 기록하여 일반화 모델 대비 명확한 시각적 및 정량적 향상을 보였다.
  • XRMB 데이터셋에서의 PPMC 측면에서 BiGRNN은 BiLSTM 및 CNN-BiLSTM 모델을 모두 초월하였으며, 특히 증강된 데이터로 훈련된 경우에 두드러진 성능 향상을 보였다.
  • 말하기자체 적응에 의한 성능 향상은 모든 말하기자체에 균일하게 나타나지 않았으며, 일부(예: JW61)에서는 최소한의 향상만 관찰되어 말하기자체 고유의 음성운동 특성에 따라 변동성이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.