Skip to main content
QUICK REVIEW

[논문 리뷰] Mel-spectrogram augmentation for sequence to sequence voice conversion

Yeongtae Hwang, Hye Min Cho|arXiv (Cornell University)|2020. 01. 06.
Speech Recognition and Synthesis참고 문헌 21인용 수 14
한 줄 요약

이 논문은 제한된 쌍체 학습 데이터를 가진 순서-순서 음성 변환(VC) 모델의 성능 향상을 위해 메르 스펙트로그램 증강 기법—특히 시간 길이 제어, 주파수 왜곡, 음량 제어—을 제안한다. 시간축 왜곡 정책, 특히 원천 및 대상에 모두 적용된 시간 길이 제어가 말하기 특성은 유지하면서 데이터 다양성을 증가시켜, 다양한 학습 데이터 크기에서 마스크링 및 기타 증강 전략을 능가하는 최고의 VC 성능을 달성함을 입증한다.

ABSTRACT

For training the sequence-to-sequence voice conversion model, we need to handle an issue of insufficient data about the number of speech pairs which consist of the same utterance. This study experimentally investigated the effects of Mel-spectrogram augmentation on training the sequence-to-sequence voice conversion (VC) model from scratch. For Mel-spectrogram augmentation, we adopted the policies proposed in SpecAugment. In addition, we proposed new policies (i.e., frequency warping, loudness and time length control) for more data variations. Moreover, to find the appropriate hyperparameters of augmentation policies without training the VC model, we proposed hyperparameter search strategy and the new metric for reducing experimental cost, namely deformation per deteriorating ratio. We compared the effect of these Mel-spectrogram augmentation methods based on various sizes of training set and augmentation policies. In the experimental results, the time axis warping based policies (i.e., time length control and time warping.) showed better performance than other policies. These results indicate that the use of the Mel-spectrogram augmentation is more beneficial for training the VC model.

연구 동기 및 목표

  • 순서-순서 음성 변환 모델 학습 시 동일 발화, 다른 화자에 대한 쌍체 음성 데이터 부족 문제를 해결하기 위해.
  • 학습 데이터가 제한된 상황에서 메르 스펙트로그램 증강의 효과성을 조사하기 위해.
  • 전체 VC 모델 재학습 없이도 훈련 비용을 줄일 수 있도록, 변형 당 열화 비율(DPD) 비율을 활용한 하이퍼파라미터 검색 전략을 개발하기 위해.
  • 기존(SpecAugment 포함) 및 신규 제안된 증강 정책들을 평가하고 비교하여 VC 품질에 미치는 영향을 분석하기 위해.

제안 방법

  • 메르 스펙트로그램 증강을 위해 SpecAugment 정책을 도입: 시간 왜곡, 주파수 마스킹, 시간 마스킹.
  • 새로운 증강 정책 제안: 주파수 왜곡(음고 변화), 음량 제어(세기 조절), 시간 길이 제어(속도 변화).
  • 전체 VC 모델을 학습하지 않고도 증강 정책의 효과를 평가하기 위해 DPD(변형 당 열화 비율) 지표를 설계.
  • 훈련 중에 온라인으로 증강 정책를 적용하고, 실험 비용을 최소화하기 위해 DPD 기반 검색을 통해 하이퍼파라미터를 조정.
  • 다양한 학습 데이터 크기(1/16에서 전체)에서 일대일 음성 변환 실험을 수행하여 정책 영향 평가.
  • 표준 VC 평가 지표인 MCD(메르-세프스트랄 왜곡), CER(문자 오류율), 자연성, 유사도를 사용해 결과를 비교.

실험 결과

연구 질문

  • RQ1제한된 쌍체 데이터에서 순서-순서 음성 변환 성능을 가장 효과적으로 향상시키는 메르 스펙트로그램 증강 정책는 무엇인가?
  • RQ2시간축 왜곡 정책은 주파수축 마스킹 및 기타 증강 전략과 비교해 VC 품질 측면에서 어떻게 성능을 냈는가?
  • RQ3DPD 지표는 전체 VC 모델을 재학습하지 않고도 효과적인 하이퍼파라미터를 신뢰성 있게 예측할 수 있는가?
  • RQ4여러 증강 정책을 조합하면 VC 성능이 향상되는가, 아니면 언어적 및 음성적 정합성이 떨어지는가?
  • RQ5증강 기법의 효과는 학습 데이터 크기에 따라 어떻게 변화하는가?

주요 결과

  • 원천 및 대상 메르 스펙트로그램에 모두 적용된 시간 길이 제어(TLC)가 전체 학습 데이터셋에서 가장 우수한 성능을 보였으며, MCD(6.641)는 최저로, 유사도(3.673)는 최고 수준을 기록했다.
  • 시간 왜곡(TW)과 TLC 모두 모든 학습 데이터 크기에서 일관된 향상을 보였으며, 전체 데이터셋에서 MCD(6.641)와 유사도(3.673)를 모두 최고로 기록했다.
  • 마스킹 정책(주파수 및 시간 마스킹)은 성능을 떨어뜨렸으며, 비판적인 언어적 및 음성 정보 손실로 인해 발생한 것으로 보인다.
  • 주파수 왜곡과 음량 제어는 미미하거나 부정적인 성과를 보였으며, 이는 화자 특성에 더 큰 왜곡을 초래할 수 있음을 시사한다.
  • 여러 정책를 조합해도 성능 향상이 없었고, 오히려 악화되는 경우가 많아 증강의 다양성과 정보 유지 간의 상충 관계가 있음을 시사한다.
  • DPD 지표는 전체 VC 모델 학습 없이도 효과적인 하이퍼파라미터를 성공적으로 식별하여 실험 비용을 크게 절감했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.