Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Cross-Lingual Transfer Learning for End-to-End Speech Recognition with Speech Translation

Changhan Wang, Juan Pino|arXiv (Cornell University)|2020. 06. 09.
Speech Recognition and Synthesis참고 문헌 40인용 수 7
한 줄 요약

이 논문은 전이 학습을 통해 저자원 말뭉치 기반의 엔드 투 엔드 음성 인식(ASR) 성능을 향상시키기 위해 음성-텍스트 번역(ST)을 중간 작업으로 활용하는 방법을 제안한다. 기계 번역된 고자원 ASR 텍스트를 기반으로 ST 모델을 훈련시킴으로써, ST와 목표 ASR 간에 전체 모델 공유가 가능해지며, 인간이 애너테이션한 번역이 필요 없이도 저자원 언어에서 최대 17.6%의 WER 감소를 달성한다.

ABSTRACT

Transfer learning from high-resource languages is known to be an efficient way to improve end-to-end automatic speech recognition (ASR) for low-resource languages. Pre-trained or jointly trained encoder-decoder models, however, do not share the language modeling (decoder) for the same language, which is likely to be inefficient for distant target languages. We introduce speech-to-text translation (ST) as an auxiliary task to incorporate additional knowledge of the target language and enable transferring from that target language. Specifically, we first translate high-resource ASR transcripts into a target low-resource language, with which a ST model is trained. Both ST and target ASR share the same attention-based encoder-decoder architecture and vocabulary. The former task then provides a fully pre-trained model for the latter, bringing up to 24.6% word error rate (WER) reduction to the baseline (direct transfer from high-resource ASR). We show that training ST with human translations is not necessary. ST trained with machine translation (MT) pseudo-labels brings consistent gains. It can even outperform those using human labels when transferred to target ASR by leveraging only 500K MT examples. Even with pseudo-labels from low-resource MT (200K examples), ST-enhanced transfer brings up to 8.9% WER reduction to direct transfer.

연구 동기 및 목표

  • 고자원 언어로부터의 향상된 전이 학습을 통해 저자원 말뭉치 기반의 엔드 투 엔드 ASR 성능을 향상시키는 것.
  • 고자원 ASR 모델에서 직접 전이할 경우 발생하는 언어 특화 어휘 불일치 문제를 해결하는 것.
  • ASR와 ST의 아키텍처와 공유 어휘를 정렬함으로써 ASR과 ST 간의 전체 모델 공유를 가능하게 하는 것.
  • 기계 번역(MT)에서 유도된 허위 레이블이 ST 훈련에서 인간이 애너테이션한 번역을 효과적으로 대체할 수 있음을 입증하는 것.
  • 상游 ST 전이가 하위 저자원 ASR 성능에 어떻게 영향을 주는지, 특히 준지도 학습 또는 보다 고품질의 허위 레이블을 통해 개선되는지 탐구하는 것.

제안 방법

  • ASR와 ST 모두에 동일한 주의 기반 인코더-디코더 아키텍처를 사용하여 파rameter 공유와 원활한 전이를 가능하게 한다.
  • 기계 번역(MT) 모델을 활용해 고자원 ASR 텍스트를 목표 저자원 언어로 기계 번역한 데이터를 기반으로 ST 모델을 훈련시킨다.
  • 기계 번역 시스템(예: Transformer base/big)에서 유도된 허위 레이블을 ST 모델의 훈련 타겟으로 활용하여 인간이 애너테이션한 번역이 필요 없도록 한다.
  • 기계 번역 허위 레이블을 활용해 데이터 분포를 단순화하고 ST 훈련 중 노이즈를 감소시키기 위해 지식 정복 원리를 적용한다.
  • 강력한 음성 표현을 유지하기 위해 사전에 고자원 ASR 모델에서 훈련된 ST 모델을 미세조정한다.
  • 통합된 인코더-디코더 아키텍처를 공유하는 다국어 ASR 모델을 훈련시어 고자원 및 저자원 언어를 모두 지원하는 다국어 환경으로 이 방법을 확장한다.
Figure 1: An overview of proposed transfer learning pipeline.
Figure 1: An overview of proposed transfer learning pipeline.

실험 결과

연구 질문

  • RQ1음성-텍스트 번역(ST)을 중간 작업으로 사용할 경우, 저자원 엔드 투 엔드 ASR에서 전이 학습 성능이 향상되는가?
  • RQ2기계 번역 허위 레이블이 인간이 애너테이션한 번역과 비교해 ST 모델 훈련에 얼마나 효과적인가?
  • RQ3더 많은 데이터 또는 자기 훈련을 통해 상위 ST 모델을 향상시키면, 저자원 언어에서 하위 ASR 성능이 향상되는가?
  • RQ4ST와 ASR 아키텍처 간의 전체 모델 공유가 전이 효율성과 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 방법이 공통 인코더-디코더 아키텍처를 공유하는 다국어 ASR 환경으로 일반화될 수 있는가?

주요 결과

  • ST 기반 전이 학습 접근법은 몽골어와 같이 저자원 언어에서 최대 17.6%의 WER 감소를 달성하며, 고자원 ASR에서 직접 전이한 경우보다 성능 향상이 뚜렷하다.
  • 포르투갈어에서는 10% 이상의 상대적 WER 감소를 기록하여, 저자원 환경에서의 강력한 성능 향상을 입증한다.
  • 기계 번역(MT)에서 유도된 허위 레이블(예: OpenSubtitles 기반의 Transformer base)은 충분한 훈련 데이터가 확보된 경우 인간이 애너테이션한 번역과 유사한 ST 모델 성능을 제공한다.
  • MT 허위 레이블 기반으로 훈련된 ST 모델은 하위 ASR 성능 향상에 기여하며, 준지도 학습 또는 고품질 허위 레이블을 통해 추가적인 성능 향상이 가능하다.
  • 특히 저자원 환경에서 인간이 애너테이션한 번역이 없이도, 직접 고자원 ASR에서 미세조정하는 것보다 더 나은 언어 모델링과 지식 전이 효과를 보이며 성능이 뛰어나다.
  • 다국어 환경에서는 ST 향상 전이 파이프라인을 통해 헤이티안어, 몽골어를 포함한 여러 저자원 언어에서 일관되게 ASR 성능 향상이 이루어진다.
Figure 2: Learning curve (training accuracy) for Mongolian (lowest-resource) and Vietnamese (highest-resource).
Figure 2: Learning curve (training accuracy) for Mongolian (lowest-resource) and Vietnamese (highest-resource).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.