Skip to main content
QUICK REVIEW

[논문 리뷰] Listening while Speaking: Speech Chain by Deep Learning

Andros Tjandra, Sakriani Sakti|arXiv (Cornell University)|2017. 07. 16.
Speech Recognition and Synthesis참고 문헌 26인용 수 16
한 줄 요약

이 논문은 레이블이 있는 데이터와 없는 데이터를 모두 사용하여 음성 인식(ASR) 및 텍스트 음성 합성(TTS) 시스템을 공동으로 훈련하는 딥러닝 기반의 클로즈드 루프 음성 체인 모델을 제안한다. ASR이 TTS에서 생성한 음성을 번역하고 TTS가 ASR 출력에서 음성을 재구성함으로써 상호 감독을 가능하게 함으로써, 짝지어진 데이터가 필요 없이 양쪽 작업의 성능을 향상시키며, ASR의 단어 오류율과 TTS의 품질 지표에서 뚜렷한 향상을 이룬다.

ABSTRACT

Despite the close relationship between speech perception and production, research in automatic speech recognition (ASR) and text-to-speech synthesis (TTS) has progressed more or less independently without exerting much mutual influence on each other. In human communication, on the other hand, a closed-loop speech chain mechanism with auditory feedback from the speaker's mouth to her ear is crucial. In this paper, we take a step further and develop a closed-loop speech chain model based on deep learning. The sequence-to-sequence model in close-loop architecture allows us to train our model on the concatenation of both labeled and unlabeled data. While ASR transcribes the unlabeled speech features, TTS attempts to reconstruct the original speech waveform based on the text from ASR. In the opposite direction, ASR also attempts to reconstruct the original text transcription given the synthesized speech. To the best of our knowledge, this is the first deep learning model that integrates human speech perception and production behaviors. Our experimental results show that the proposed approach significantly improved the performance more than separate systems that were only trained with labeled data.

연구 동기 및 목표

  • 사람의 음성 소통에서 핵심적인 역할을 하는 음성 인식(ASR)과 텍스트 음성 합성(TTS) 연구 간 격차를 해소하기 위해, 이 둘은 역사적으로 별개로 발전해왔음에도 불구하고.
  • 화자가 청각 피드백을 통해 자신의 음성을 모니터링하는 인간의 음성 체인 메커니즘을 모방하기 위해 신경망에 클로즈드 루프 학습 아키텍처를 구현한다.
  • ASR와 TTS 간의 상호 감독을 통해 레이블이 있는 데이터와 없는 데이터를 모두 활용하여 ASR 및 TTS 성능을 향상시킨다.
  • 단일 화자 합성 음성 및 다중 화자 자연 음성 데이터셋에서 이 공동 훈련 프레임워크의 효과성을 검증한다.

제안 방법

  • 레이블이 있는 음성-텍스트 쌍과 레이블이 없는 음성 또는 텍스트 데이터를 사용하여, 번갈아가며 ASR과 TTS를 훈련하는 순서에서 순서로 구성된 클로즈드 루프 아키텍처를 제안한다.
  • 훈련 중 티처 포싱을 사용한다: ASR은 참조 전사문을 사용하여 음성에서 텍스트를 생성하고, TTS는 참조 텍스트를 사용하여 음성을 생성한다.
  • 이중 학습 메커니즘을 도입한다: ASR은 TTS가 생성한 음성에서 텍스트를 재구성하고, TTS는 ASR이 생성한 텍스트에서 음성을 재구성함으로써 피드백 루프를 형성한다.
  • 재구성 작업에서의 비지도 손실을 활용한다: ASR은 합성된 음성에서 손실을 계산하고, TTS는 재구성된 음성 웨이브폼에서 손실을 계산한다.
  • 쌍화된 데이터에 대한 지도 손실과 비쌍화된 데이터에 대한 비지도 손실의 가중 조합을 사용하며, 초모델 파라미터 α와 β가 균형을 조절한다.
  • 모든 레이어를 동결하고 화자 임베딩 레이어만 제외하여 사전 훈련된 단일 화자 모델에서 다중 화자 설정으로 지식을 전이한다.

실험 결과

연구 질문

  • RQ1ASR과 TTS를 통합한 공동 훈련 프레임워크가 레이블이 있는 데이터만으로 별도 훈련하는 것보다 성능을 향상시킬 수 있는가?
  • RQ2비쌍화된 데이터만을 사용하여 ASR과 TTS 간의 상호 감독이 두 시스템의 성능 향상에 얼마나 효과적인가?
  • RQ3음성 합성에서 인식으로의 피드백을 포함한 클로즈드 루프 아키텍처가 ASR 및 TTS 작업의 강건성과 정확도를 향상시키는가?
  • RQ4다양한 초모델 파라미터 설정(α와 β)이 공동 훈련에서의 성능 향상에 어떤 영향을 미치는가?
  • RQ5제안된 모델은 다중 화자 환경으로 일반화되어 자연스럽고 즉각적인 음성에서 성능 향상을 이끌 수 있는가?

주요 결과

  • 제안된 클로즈드 루프 음성 체인 모델은 α=0.5와 β=1일 때 다중 화자 테스트 세트에서 20.91%의 단어 오류율(WER)을 기록하여, 기준선 쌍화된 데이터 전용 모델(26.47% WER)을 능가했다.
  • 쌍화된 데이터와 비쌍화된 데이터 모두에서 훈련할 경우, 멜 스펙트로그램 재구성 손실은 10.213에서 9.137로 감소했고, 원시 웨이브폼 손실은 13.175에서 12.863으로 감소했다.
  • 다중 화자 환경에서 α=0.5를 사용할 경우 α=0.25보다 성능 향상이 뚜렷하게 향상되었으며, 초기 모델이 덜 정확할 경우 쌍화된 데이터에서 더 강한 감독이 유리함을 시사한다.
  • 다중 화자 테스트 세트에서 화자 확인 정확도가 98.6%에 도달하여 화자 신원 유지 능력이 뛰어나다는 것을 입증했다.
  • 비쌍화된 데이터를 사용한 공동 훈련은 ASR과 TTS 양쪽 모두에서 일관된 성능 향상을 이끌었으며, 상호 피드백이 표현 학습을 향상시킨다는 것을 보여주었다.
  • 이 방법은 딥러닝 프레임워크에서 인간과 유사한 음성 인지 및 생산 행동을 통합한 최초의 사례로, 종단간 음성 체인 모델링의 가능성은 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.