Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Automatic Speech Translation of Audiobooks

Alexandre Bérard, Laurent Besacier|arXiv (Cornell University)|2018. 02. 12.
Natural Language Processing Techniques참고 문헌 20인용 수 126
한 줄 요약

이 논문은 236시간의 정렬된 영어 음성과 프랑스어 번역을 포함한 보강된 LibriSpeech 코퍼스를 사용하여 영어-프랑스어 오디오북을 위한 엔드 투 엔드 자동 음성 번역(_AST_) 모델을 제시한다. 원천 번역 없이 또는 학습 중에만 원천 번역을 사용하는 엔드 투 엔드 모델과 계단식 ASR+MT 시스템을 비교하여, 사전 훈련과 다중 작업 학습이 성능을 향상시킴을 보여주지만, 실제 음성에서는 여전히 계단식 모델이 엔드 투 엔드 모델을 앞서는 것으로 나타났다.

ABSTRACT

We investigate end-to-end speech-to-text translation on a corpus of audiobooks specifically augmented for this task. Previous works investigated the extreme case where source language transcription is not available during learning nor decoding, but we also study a midway case where source language transcription is available at training time only. In this case, a single model is trained to decode source speech into target text in a single pass. Experimental results show that it is possible to train compact and efficient end-to-end speech translation models in this setup. We also distribute the corpus and hope that our speech translation baseline on this corpus will be challenged in the future.

연구 동기 및 목표

  • 병렬 음성과 목표 텍스트를 갖춘 대규모 실세계 오디오북 코퍼스에서 엔드 투 엔드 음성-텍스트 번역을 조사한다.
  • 학습 중에만 원어 번역을 사용하는 엔드 투 엔드 AST 모델과 원어 번역을 학습 및 추론 모두에서 사용하지 않는 모델의 성능을 비교한다.
  • 새로 생성된 공개 오디오북 코퍼스를 사용하여 향후 엔드 투 엔드 AST 연구를 위한 강력한 베이스라인을 확립한다.
  • 사전 훈련과 다중 작업 학습이 컴act한 엔드 투 엔드 AST 모델의 성능 향상에 얼마나 기여하는지 평가한다.
  • 제한된 원어 번역 접근성 조건에서도 엔드 투 엔드 모델이 실제 음성에서 경쟁 가능한 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 영어 오디오북 음성과 프랑스어 전자책 번역을 정렬하여 236시간의 병렬 음성과 목표 텍스트를 생성함으로써 LibriSpeech 코퍼스를 보강한다.
  • 원시 음성(MFCC)에서 계층적 특징을 추출하기 위해 합성곱층과 양방향 LSTMs를 조합한 하이브리드 음성 인코더를 사용한다.
  • 목표 텍스트를 토큰 단위로 생성하기 위해 조건부 LSTM과 글로벌 어텐션 메커니즘을 갖춘 문자 수준 디코더를 구현한다.
  • 단일 인코더-디코더 아키텍처를 사용하여 엔드 투 엔드 AST 모델을 훈련하며, 다중 작업 학습을 위해 ASR과 MT의 디코더를 공유한다.
  • AST, ASR, MT 작업 간의 교차 업데이트를 통해 다중 작업 훈련을 적용하며, AST에 60%의 업데이트 비율, ASR과 MT에 각각 20%를 할당한다.
  • 훈련 안정성과 메모리 제약을 관리하기 위해 변동형 드롭아웃과 입력 자르기(음성은 1400프레임, 텍스트는 300문자)를 적용한다.

실험 결과

연구 질문

  • RQ1추론 중에 원어 번역이 필요 없이 엔드 투 엔드 음성-텍스트 번역 모델이 실제 오디오북 음성에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2학습 중에만 원어 번역이 이용 가능한 경우, 완전히 엔드 투 엔드 설정과 비교해 성능에 어떤 영향을 미치는가?
  • RQ3사전 훈련과 다중 작업 학습이 대규모 실세계 음성에서 컴팩트한 엔드 투 엔드 AST 모델의 성능 향상에 얼마나 기여하는가?
  • RQ4실제 오디오북 음성에서 엔드 투 엔드 AST의 성능은 계단식 ASR+MT 파ipeline과 비교해 어떻게 되는가?
  • RQ5제안된 보강된 LibriSpeech 코퍼스는 향후 엔드 투 엔드 AST 연구를 위한 타당하고 도전적인 벤치마크로 적합한가?

주요 결과

  • BTEC 합성 코퍼스에서 계단식 ASR+MT 시스템은 BLEU 점수 43.8을 기록하여 가장 우수한 엔드 투 엔드 모델(37.9 BLEU)과 사전 훈련 모델(40.4 BLEU)을 모두 앞섰다.
  • 실제 오디오북 코퍼스(Augmented LibriSpeech)에서 계단식 모델은 15.8 BLEU를 기록했고, 가장 우수한 엔드 투 엔드 모델은 15.5 BLEU를 기록하여 도전적인 실세계 데이터 조건에서도 뛰어난 성능을 보였다.
  • 사전 훈련은 수렴 속도를 크게 향상시켰으며, 사전 훈련 모델은 단지 129,000단계 만에 LibriSpeech에서 13.3 BLEU 점수를 달성한 반면, 엔드 투 엔드 모델은 369,000단계가 걸렸다.
  • 사전 훈련과 결합된 다중 작업 훈련은 성능 향상에 기여하지 않았으며, 이는 이 설정에서는 사전 훈련만으로도 더 빠른 수렴이 가능하다는 것을 시사한다.
  • 문자 수준 디코더의 사용은 이전 연구 대비 성능 향상을 이끌었으며, 1040만 파라미터 엔드 투 엔드 모델은 BTEC에서 31.3 BLEU를 기록했고, 이는 이전 연구의 29.1 BLEU보다 높았다.
  • 코퍼스는 도전적이다: 구글 번역도 LibriSpeech 테스트 세트에서 단지 22.2 BLEU 점수를 기록하여 실제 오디오북 음성에서 고품질 번역을 달성하는 것이 여전히 어렵다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.