Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Feedback Loss in Speech Chain Framework via Straight-Through Estimator

Andros Tjandra, Sakriani Sakti|arXiv (Cornell University)|2018. 10. 31.
Speech Recognition and Synthesis참고 문헌 21인용 수 5
한 줄 요약

이 논문은 직렬화된 음성 체인 프레임워크 내에서 텍스트-to-음성(TTS)에서의 재구성 손실이 이산 자동 음성 인식(ASR) 출력을 통해 역전파될 수 있도록 하는 엔드투엔드 피드백 손실 메커니즘을 제안한다. 직렬 전이 추정기(ST)를 사용하여 ASR 출력을 통해 역전파를 가능하게 하며, 교사-강요(teacher-forcing)와 함께 ST-Gumbel-Softmax 샘플링을 적용함으로써 ASR에서 11% 상대적 문자 오류률(CER) 감소를 달성한다. 이는 TTS와 ASR를 동시에 최적화하는 데 효과적임을 보여준다.

ABSTRACT

The speech chain mechanism integrates automatic speech recognition (ASR) and text-to-speech synthesis (TTS) modules into a single cycle during training. In our previous work, we applied a speech chain mechanism as a semi-supervised learning. It provides the ability for ASR and TTS to assist each other when they receive unpaired data and let them infer the missing pair and optimize the model with reconstruction loss. If we only have speech without transcription, ASR generates the most likely transcription from the speech data, and then TTS uses the generated transcription to reconstruct the original speech features. However, in previous papers, we just limited our back-propagation to the closest module, which is the TTS part. One reason is that back-propagating the error through the ASR is challenging due to the output of the ASR are discrete tokens, creating non-differentiability between the TTS and ASR. In this paper, we address this problem and describe how to thoroughly train a speech chain end-to-end for reconstruction loss using a straight-through estimator (ST). Experimental results revealed that, with sampling from ST-Gumbel-Softmax, we were able to update ASR parameters and improve the ASR performances by 11\% relative CER reduction compared to the baseline.

연구 동기 및 목표

  • TTS 재구성 손실이 이산 ASR 출력을 통해 역전파될 수 있도록 하는 엔드투엔드 학습이 가능한 음성 체인 프레임워크를 구현하는 것.
  • 이산 ASR 토큰의 비미분 가능성 문제를 해결하기 위해 직렬 전이 추정기를 사용하는 것.
  • 감독 학습 환경에서도 TTS 재구성에서 온 피드백을 통해 ASR 성능을 향상시키는 것.
  • 다양한 복원 전략(예: 근사, 빔 서치, Gumbel-Softmax)이 기울기 흐름을 어떻게 영향을 주는지 조사하는 것.
  • ASR와 TTS 모듈을 함께 최적화하는 데 사용되는 통합 손실 함수를 포함한 완전한 엔드투엔드 학습을 달성하는 것.

제안 방법

  • 이산 ASR 출력을 통해 기울기를 추정할 수 있도록 직렬 전이 추정기(ST)를 사용하여 TTS에서 ASR으로의 역전파를 가능하게 한다.
  • 학습 중 ASR 디코더 출력에서 기울기적으로 샘플링하기 위해 ST-Gumbel-Softmax 샘플링을 적용하여 이산 토큰을 통한 기울기 추정을 가능하게 한다.
  • 표준 ASR 손실($\mathcal{L}_{\text{ASR}}$)과 함께 TTS 재구성 손실($\mathcal{L}^{\text{rec}}_{\text{TTS}}$)을 전체 학습 목표에 통합한다.
  • 학습 안정성 향상과 기울기 신호 품질 향상을 위해 ASR 디코딩 중 교사-강요를 적용한다.
  • ASR 모델에 1-히스토리 크기의 다중 척도 주의 메커니즘과 LReLU 활성화 함수를 사용하며, TTS에 대해 Tacotron을 수정하여 8개의 필터 베이드와 256차원 LSTM을 사용한다.
  • 개발 세트에서 최적의 CER를 달성하기 위해 온도 하이퍼파라미터($\tau$)를 $[0.25, 0.5, 1, 2]$ 범위에서 최적화한다.

실험 결과

연구 질문

  • RQ1이산 ASR 출력의 비미분성에도 불구하고 TTS 재구성 손실이 ASR 파rameter를 효과적으로 업데이트할 수 있는가?
  • RQ2복원 전략 선택(예: 근사, 빔 서치, Gumbel-Softmax 샘플링)이 엔드투엔드 피드백 학습 성능에 어떤 영향을 미치는가?
  • RQ3직렬 전이 추정기가 음성 체인 프레임워크에서 기울기 추정과 모델 수렴에 미치는 영향은 어떠한가?
  • RQ4TTS 재구성 손실을 통한 엔드투엔드 피드백 학습이 표준 벤치마크에서 ASR 성능 향상에 측정 가능한 영향을 미치는가?
  • RQ5교사-강요와 ST-Gumbel-Softmax의 조합이 다른 학습 전략 대비 CER 감소 측면에서 어떻게 비교되는가?

주요 결과

  • 교사-강요와 함께 ST-Gumbel-Softmax 샘플링을 적용한 본 논문의 방법은 최상의 베이스라인 모델(Att MLP-MA) 대비 11% 상대적 CER 감소를 달성하였다.
  • ${\cal L}_{\text{ASR}} + {\cal L}^{\text{rec}}_{\text{TTS}}$와 ST-Gumbel-Softmax를 사용한 모델은 argmax나 근사 복원을 사용한 모든 베이스라인 설정보다 뛰어난 성능을 보였다.
  • 제안된 모델은 WSJ test_eval92 세트에서 CER가 5.7%에 도달했으며, 베이스라인 Att MLP-MA 모델의 6.43% 대비 향상된 성능을 보였다.
  • 교사-강요와 함께 Gumbel-Softmax 샘플링을 사용한 결과가 가장 우수한 성능을 보였으며, 기울기 근사를 통한 확률적 샘플링이 결정적 복원보다 더 효과적임을 시사한다.
  • 본 방법은 이산 출력을 통해 TTS에서 ASR으로의 기울기 흐름을 성공적으로 가능하게 하여, 직렬 전이 추정기가 음성 체인 프레임워크에서 유효하게 사용될 수 있음을 검증하였다.
  • 다양한 설정에서 일관된 향상이 관찰되어, 적절한 샘플링 및 학습 전략과 결합된 피드백 메커니즘이 뛰어난 강건성을 확보하고 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.