Skip to main content
QUICK REVIEW

[논문 리뷰] Back-Translation-Style Data Augmentation for End-to-End ASR

Tomoki Hayashi, Shinji Watanabe|arXiv (Cornell University)|2018. 07. 28.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 쌍이 맞지 않는 텍스트를 활용하여 엔드 투 엔드 음성 인식(E2E-ASR)을 위한 백트랜스레이션 스타일의 데이터 증강 방법을 제안한다. 이는 사전에 트레이닝된 E2E-ASR 인코더의 은닉 상태를 예측할 수 있도록 텍스트에서 인코더(TTE) 모델을 학습시켜, 이러한 생성된 은닉 상태를 추가 학습 데이터로 사용함으로써, 쌍이 맞는 음성-텍스트 데이터가 필요 없이도 ASR 디코더의 성능을 향상시키고 알 수 없는 단어 비율을 감소시킨다. 실험 결과, LibriSpeech 데이터셋에서 CER과 WER 모두 유의미한 개선을 보였다.

ABSTRACT

In this paper we propose a novel data augmentation method for attention-based end-to-end automatic speech recognition (E2E-ASR), utilizing a large amount of text which is not paired with speech signals. Inspired by the back-translation technique proposed in the field of machine translation, we build a neural text-to-encoder model which predicts a sequence of hidden states extracted by a pre-trained E2E-ASR encoder from a sequence of characters. By using hidden states as a target instead of acoustic features, it is possible to achieve faster attention learning and reduce computational cost, thanks to sub-sampling in E2E-ASR encoder, also the use of the hidden states can avoid to model speaker dependencies unlike acoustic features. After training, the text-to-encoder model generates the hidden states from a large amount of unpaired text, then E2E-ASR decoder is retrained using the generated hidden states as additional training data. Experimental evaluation using LibriSpeech dataset demonstrates that our proposed method achieves improvement of ASR performance and reduces the number of unknown words without the need for paired data.

연구 동기 및 목표

  • 음성 신호와 쌍이 맞지 않는 대량의 비쌍이 텍스트를 활용하여 엔드 투 엔드 ASR 성능을 향상시키는 것.
  • 주의 기반 E2E-ASR 모델이 별도의 언어 모델 모듈 없이 대규모 비쌍이 텍스트를 효과적으로 활용할 수 있는 한계를 해결하는 것.
  • 원시 음성 특징 대신 은닉 상태를 타겟으로 사용하여 계산 비용을 줄이고 주의 메커니즘 학습을 가속화하는 것.
  • 하나의 인코더 표현을 부분적으로 샘플링하여 합성 데이터 생성 시 과적합과 화자 특이성 편향을 완화하는 것.
  • 음성 합성 또는 음소 기반 생성 파이프라인 없이도 효과적인 데이터 증강을 가능하게 하는 것.

제안 방법

  • 문자 시퀀스에서 사전에 트레이닝된 E2E-ASR 인코더의 은닉 상태를 예측할 수 있도록 텍스트에서 인코더(TTE) 모델을 학습시키는 것.
  • 원시 음성 특징 대신, 부분적으로 샘플링된 인코더 출력에서 유도된 은닉 상태를 타겟으로 사용하여 계산 비용을 줄이고 화자 변동성을 모델링하는 것을 방지하는 것.
  • 주의 메커니즘 학습 속도를 향상시키고 오토인코더 유사 행동을 방지하기 위해 평균 제곱오차와 L1 노름 손실의 조합을 사용하여 TTE 모델을 학습하는 것.
  • 학습된 TTE 모델을 사용하여 대량의 비쌍이 텍스트 코퍼스에서 합성 은닉 상태를 생성하는 것.
  • 기존 학습 데이터와 함께 생성된 은닉 상태를 추가로 감독 신호로 사용하여 E2E-ASR 디코더를 재학습하는 것.
  • 기존의 얕은 융합 기법과 결합하여 문자 기반 언어 모델을 사용하여 인식 성능을 추가로 향상시키는 것.
Fig. 1 : Overview of proposed back-translation-style data augmentation method.
Fig. 1 : Overview of proposed back-translation-style data augmentation method.

실험 결과

연구 질문

  • RQ1쌍이 맞지 않는 텍스트를 쌍이 맞는 음성-텍스트 데이터가 없이도 엔드 투 엔드 ASR 성능 향상에 효과적으로 활용할 수 있는가?
  • RQ2텍스트에서 인코더 모델에 원시 음성 특징 대신 ASR 인코더의 은닉 상태를 타겟으로 사용할 경우, 주의 메커니즘 학습이 더 빠르고 효율적인가?
  • RQ3백트랜스레이션 스타일의 방법을 통해 생성된 합성 데이터가 ASR 인식에서 알 수 없는 단어의 수를 줄일 수 있는가?
  • RQ4원시 음성 특징 대신 은닉 상태를 사용할 경우, 합성 데이터의 일반화 능력과 화자 변동성에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 기존의 언어 모델 통합 기법(예: 얕은 융합)과 효과적으로 조합될 수 있는가?

주요 결과

  • 제안된 방법을 사용하여 LibriSpeech 검증 세트에서 WER이 23.0%에서 21.6%로 감소하였고, 평가 세트에서는 22.9%에서 22.0%로 감소하였다. 언어 모델과 조합했을 때의 성능 향상 효과가 확인되었다.
  • TTE 모델의 목적 함수에 L1 노름 손실을 사용함으로써 주의 메커니즘 학습 속도가 가속화되었으며, 평균 제곱오차만을 사용할 때보다 3분의 1 이하의 에포크 수로 효과적인 주의 메커니즘이 학습되었다.
  • 오직 생성된 은닉 상태로만 디코더를 재학습시켰을 경우 과적합이 발생했고 성능 향상이 없었으며, 이는 원본 데이터와 합성 데이터를 함께 사용하는 것이 필수적임을 시사한다.
  • 합성 데이터를 통해 디코더의 언어 모델 능력을 활용함으로써 알 수 없는 단어의 수를 성공적으로 줄였고, 어휘 커버리지가 향상되었다.
  • 얕은 융합과의 호환성이 확인되어, 문자 기반 언어 모델과 조합함으로써 검증 및 테스트 세트에서 모두 인식 성능이 향상되었다.
  • 결과적으로 생성된 은닉 상태의 화자 변동성은 제한적이며, 향후 작업에서 다중 화자 모델링을 통합하여 데이터 다양성을 향상시켜야 할 필요가 있다.
(a) Attetion-based ASR model
(a) Attetion-based ASR model

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.