Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-Guided Generative Adversarial Network for Whisper to Normal Speech Conversion

Teng Gao, Jian Zhou|arXiv (Cornell University)|2021. 11. 02.
Speech and Audio Processing참고 문헌 25인용 수 4
한 줄 요약

이 논문은 프레임 수준에서 자기주의 어텐션 메커니즘을 사용하여 시간을 적응적으로 정렬함으로써 기본 주파수 추정과 동적 시간 왜곡(DTW) 정렬이 필요 없도록 하는 어텐션 가이드형 생성 적대 신경망(AGAN-W2SC)을 제안한다. 이 모델은 뛰어난 음성 품질과 이해도를 달성하며, P.563 점수 1.872를 기록하여 GMM, BLSTM, Cycle-GAN과 같은 DTW 기반 기준 모델들을 능가한다.

ABSTRACT

Whispered speech is a special way of pronunciation without using vocal cord vibration. A whispered speech does not contain a fundamental frequency, and its energy is about 20dB lower than that of a normal speech. Converting a whispered speech into a normal speech can improve speech quality and intelligibility. In this paper, a novel attention-guided generative adversarial network model incorporating an autoencoder, a Siamese neural network, and an identity mapping loss function for whisper to normal speech conversion (AGAN-W2SC) is proposed. The proposed method avoids the challenge of estimating the fundamental frequency of the normal voiced speech converted from a whispered speech. Specifically, the proposed model is more amendable to practical applications because it does not need to align speech features for training. Experimental results demonstrate that the proposed AGAN-W2SC can obtain improved speech quality and intelligibility compared with dynamic-time-warping-based methods.

연구 동기 및 목표

  • 명시적인 기본 주파수(F0) 추정이 필요 없이 속삭임 음성을 일반 음성으로 변환하는 데 도전하는 것.
  • 학습 데이터에서 동적 시간 왜곡(DTW)을 통한 시간 정렬이 필요 없도록, 자기주의 어텐션 메커니즘을 통해 적응적인 프레임 수준 정렬을 가능하게 하는 것.
  • 속삭임 음성 스펙트럼에서 일반 음성 스펙트럼으로의 강건한 매핑을 학습하여 음성 품질과 이해도를 향상시키는 것.
  • 멀티 파rameter 특징 매핑이나 강제된 지속 시간 정렬 없이 메르 스펙트로그램에 직접 작용하는 유연하고 엔드 투 엔드의 딥 러닝 모델을 개발하는 것.

제안 방법

  • U-Net 유사 인코더-디코더 생성자와 패치 기반 판별자를 사용한 GAN 프레임워크를 채택하여 적대적 훈련을 수행한다.
  • 인코더에 자기주의 어텐션 모듈을 통합하여 국소 스펙트럼 특징을 적응적으로 가중하고, 속삭임 음성과 일반 음성 프레임 간의 암묵적 시간 정렬을 가능하게 한다.
  • 변환 과정 중에 콘텐츠 정보를 유지하기 위해 오토인코더 구성 요소를 사용하여 재구성 정밀도를 향상시킨다.
  • 속삭임 음성과 일반 음성의 임베딩 특징을 비교하기 위해 시아미즈 신경망을 활용하여 분류 표현 학습을 지원한다.
  • 변환 과정 중 원본 음성 콘텐츠를 유지하기 위해 아이덴티티 매핑 손실을 적용하여 왜곡을 줄인다.
  • 생성자 훈련 비율을 판별자 대비 3:1로 설정하고, 수렴 안정성을 확보하기 위해 학습률를 0.0001에서 0.0002 사이로 설정한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 명시적인 기본 주파수 추정에 의존하지 않고 속삭임 음성을 일반 음성으로 변환할 수 있는가?
  • RQ2자기주의 어텐션 메커니즘이 속삭임 음성에서 일반 음성으로의 변환에서 시간 정렬을 위해 동적 시간 왜곡(DTW)을 효과적으로 대체할 수 있는가?
  • RQ3프레임 수준의 훈련을 통해 엔드 투 엔드 GAN 기반 접근 방식이 전통적인 DTW 정렬 방법보다 음성 품질과 이해도 측면에서 뛰어나게 성능을 내는가?
  • RQ4비록 속삭임 음성에서 간성 운동 자극이 없더라도 제안된 모델이 청각적으로 자연스러운 음성과 경쟁 가능한 F0 컨투어를 생성할 수 있는가?

주요 결과

  • 제안된 AGAN-W2SC 모델은 P.563 점수 1.872를 기록하여 GMM(1.163), BLSTM(1.247), Cycle-GAN(1.107)과 같은 기준 모델들을 뛰어넘어 뛰어난 객관적 음성 품질을 입증한다.
  • AGAN-W2SC가 생성한 변환 음성의 F0 컨투어는 기준 일반 음성과 매우 유사하여 효과적인 암묵적 F0 생성을 보여준다.
  • 변환된 음성과 기준 음성 간의 기본 주파수 RMSE는 기준 방법들과 비교해 유사하거나 더 낮으며, 침묵 프레임 제거 후 처리된 F0 RMSE는 더 뛰어난 강건성을 보였다.
  • 주관적 평가에서 AGAN-W2SC는 항상 가장 낮은 RMSE를 기록하지는 않지만, 더 매끄럽고 자연스러운 음성 톤을 생성하여 선호된다.
  • 고정 길이 입력이 필요 없이 프레임 수준에서 작동하므로, 다양한 지속 시간을 가진 속삭임과 일반 음성 쌍에 더 민첩하고 적합한 모델이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.