Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Whisper to Natural Speech Conversion using Modified Transformer Network

Abhishek Niranjan, Mukesh Sharma|arXiv (Cornell University)|2020. 04. 20.
Speech Recognition and Synthesis참고 문헌 29인용 수 6
한 줄 요약

이 논문은 병렬 및 비병렬 데이터를 활용하여 프레임 수준의 음소 예측을 위한 보조 디코더를 통합한 향상된 트랜스포머 기반 엔드 투 엔드 프레임워크를 제안한다. 이는 속삭임 음성에서 자연스러운 음성으로의 변환을 위한 것이다. 변환된 음성을 엔드 투 엔드 음성 인식 시스템에 입력했을 때 wTIMIT 및 CHAINS 데이터셋에서 단어 오류률(WER)이 65% 감소했으며, 새로운 형성 분산 거리 측정법을 통해 실제 형성 분포와 유사한 결과를 도출하였다.

ABSTRACT

Machine recognition of an atypical speech like whispered speech, is a challenging task. We introduce whisper-to-natural-speech conversion using sequence-to-sequence approach by proposing enhanced transformer architecture, which uses both parallel and non-parallel data. We investigate different features like Mel frequency cepstral coefficients and smoothed spectral features. The proposed networks are trained end-to-end using supervised approach for feature-to-feature transformation. Further, we also investigate the effectiveness of embedded auxillary decoder used after N encoder sub-layers, trained with the frame-level objective function for identifying source phoneme labels. We show results on opensource wTIMIT and CHAINS datasets by measuring word error rate using end-to-end ASR and also BLEU scores for the generated speech. Alternatively, we also propose a novel method to measure spectral shape of it by measuring formant distributions w.r.t. reference speech, as formant divergence metric. We have found whisper-to-natural converted speech formants probability distribution is similar to the groundtruth distribution. To the authors' best knowledge, this is the first time enhanced transformer has been proposed, both with and without auxiliary decoder for whisper-to-natural-speech conversion and vice versa.

연구 동기 및 목표

  • 기계의 이해 가능성 향상을 위해 자동 음성 인식(ASR)에서 속삭임 음성을 자연스러운 음성으로 변환함으로써 달성한다.
  • 비표준 음성 인식에서의 데이터 부족 문제를 해결하기 위해 병렬 및 비병렬 훈련 데이터를 모두 활용한다.
  • 훈련 중에 프레임 수준의 음소 인식을 위한 임베디드 보조 디코더를 표준 트랜스포머 아키텍처에 통합함으로써 아키텍처를 향상시킨다.
  • E2E ASR의 WER과 형성 분산 거리 측정법을 통한 스펙트럼 유사도를 통해 제안된 모델의 효과성을 평가한다.
  • 자연음성에서 속삭임 음성으로의 양방향 변환 기능을 입증하며, 이를 보조 실험으로 제시한다.

제안 방법

  • N개의 인코더 서브레이어 이후에 보조 디코더를 삽입한 향상된 트랜스포머 네트워크를 제안하며, 이는 프레임 수준의 음소 분류 목표로 훈련된다.
  • 모델은 순서에서 순서로의 특징 변환을 수행하며, k개의 입력 프레임(속삭임)을 k개의 출력 프레임(자연스러운 음성)으로 변환하여 온라인 변환을 수행한다.
  • 두 가지 특징 유형을 평가: 멜 주파수 침술 계수(MFCCs) 및 스무딩된 스펙트럼 특징으로, MFCCs가 더 뛰어난 성능을 보였다.
  • 데이터 부족 문제를 완화하기 위해 병렬 및 비병렬 데이터를 모두 사용하여 지도 학습 기반으로 엔드 투 엔드로 훈련된다.
  • 스펙트럼 형태 유사도는 형성 주파수 F1–F4의 혼합 정규분포(GMMs) 간의 KL-발산 기반으로 새로운 형성 분산 거리 측정법(FDM)을 사용하여 측정된다.
  • 평가를 위해 변환된 음성 특징에서 자연스러운 음성을 합성하기 위해 WORLD 보코더를 사용한다.

실험 결과

연구 질문

  • RQ1보조 디코더를 갖춘 향상된 트랜스포머가 기존 모델 대비 속삭임 음성에서 자연스러운 음성으로의 변환 품질을 향상시키는가?
  • RQ2병렬 및 비병렬 데이터를 결합함으로써 자원이 적은 비표준 음성 인식 환경에서 모델 성능이 유의미하게 향상되는가?
  • RQ3변환된 음성이 스펙트럼 유사도 측정 기준으로 목표 음성의 형성 분포를 어느 정도 유지하는가?
  • RQ4엔드 투 엔드 ASR 시스템에서 디코딩했을 때 변환된 음성의 성능은 원본 속삭임 음성 대비 어떻게 비교되는가?
  • RQ5제안된 아키텍처는 자연음성에서 속삭임 음성으로의 반대 방향 변환 작업에 효과적으로 적용될 수 있는가? 이를 통해 양방향 기능을 입증할 수 있는가?

주요 결과

  • MFCC 기반 보조 디코더를 갖춘 W2 모델은 E2E ASR 시스템에서 wTIMIT 데이터셋에서 WER이 65% 상대적으로 감소했으며, 원본 속삭임 음성보다 유의미하게 뛰어난 성능을 보였다.
  • CHAINS 데이터셋에서는 W2 모델이 기준 속삭임 입력 대비 약 65%의 WER 감소를 기록했지만, 약간의 높은 삽입률로 인해 전체 정확도가 약간 감소했다.
  • wTIMIT 테스트 세트에서 W2 모델은 BLEU 점수 85.36을 기록했으며, CHAINS에서는 62.68를 기록하여 생성된 음성의 유창성과 의미 유사도가 매우 높음을 나타냈다.
  • 형성 분산 거리 측정법(FDM)은 W2가 생성한 음성이 기준 W1보다 더 낮은 분산(형성 F1: 0.1034)을 보였으며, 이는 더 높은 스펙트럼 정밀도를 의미한다.
  • 보조 디코더의 존재가 성능 향상에 기여했음을 확인했으며, 보조 디코딩 기능이 있는 W2 및 V2 모델이 없는 W1 및 V1 모델보다 WER 및 FDM 측정치에서 뛰어난 성능을 보였다.
  • spectrogram 및 형성 분석 결과, W2가 생성한 음성은 자연스러운 음성의 스펙트럼 에너지 및 형성 궤적을 매우 유사하게 모방하고 있으며, 특히 F1 및 F2에서 두드러진 유사성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.