Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual End-to-End Speech Translation

Hirofumi Inaguma, Kevin Duh|arXiv (Cornell University)|2019. 10. 01.
Natural Language Processing Techniques참고 문헌 59인용 수 5
한 줄 요약

이 논문은 모든 언어 조합 간에 파rameter를 공유하는 유니버설 시퀀스 투 시퀀스 모델을 사용하여 다국어 종단 간 음성 번역(E2E-ST) 프레임워크를 제안한다. 이는 다수의 원천 언어에서 다수의 목표 언어로 직접 음성을 번역한다. 일대다 및 다대다 번역 시나리오에서 이중 언어 모델보다 뚜렷한 성능 향상을 보이며, Mboshi–프랑스어와 같은 저자원 언어 조합에 대해 강력한 제로샷 일반화 성능을 보인다.

ABSTRACT

In this paper, we propose a simple yet effective framework for multilingual end-to-end speech translation (ST), in which speech utterances in source languages are directly translated to the desired target languages with a universal sequence-to-sequence architecture. While multilingual models have shown to be useful for automatic speech recognition (ASR) and machine translation (MT), this is the first time they are applied to the end-to-end ST problem. We show the effectiveness of multilingual end-to-end ST in two scenarios: one-to-many and many-to-many translations with publicly available data. We experimentally confirm that multilingual end-to-end ST models significantly outperform bilingual ones in both scenarios. The generalization of multilingual training is also evaluated in a transfer learning scenario to a very low-resource language pair. All of our codes and the database are publicly available to encourage further research in this emergent multilingual ST topic.

연구 동기 및 목표

  • 이중 언어 종단 간 음성 번역의 한계를 해결하기 위해 다수의 원천 언어와 목표 언어 간의 다국어 학습을 가능하게 한다.
  • 개별 ASR 및 MT 모듈 간의 오류 전파를 제거하기 위해 통합된 프레임워크에서 음성을 직접 목표 텍스트로 매핑함으로써 종단 간 번역을 실현한다.
  • 다국어 사전 학습과 전이 학습을 통해 저자원 환경에서의 성능 향상과 일반화 능력을 향상시킨다.
  • 언어별 모델링과 복잡한 파ip라인 디코딩을 피하는 통합적이고 파rameter 효율적인 아키텍처를 제공한다.
  • 다국어 E2E-ST를 위한 코드와 데이터를 공개함으로써 재현 가능한 연구를 촉진한다.

제안 방법

  • 모든 언어 조합 간에 인코더와 디코더 파rameter를 공유하는 유니버설 시퀀스 투 시퀀스 모델을 사용하여, 다국어 음성 번역 데이터를 통합적으로 학습한다.
  • 다국어 환경에서의 데이터 희소성과 어휘 폭발 문제를 완화하기 위해 원천 및 목표 시퀀스 모두에 문자 수준의 토큰화를 적용한다.
  • 주의 기반 인코더-디코더 아키텍처를 활용하여 음성에서 텍스트로의 번역을 공동 최적화하는 종단 간 학습을 수행한다.
  • 저자원 언어 모델(예: Mboshi–프랑스어)을 다국어 사전 학습된 E2E-ST 모델에서 초기화함으로써 전이 학습을 수행하며, 사전 학습 단계에서 Mboshi 전사 자료를 사용하지 않는다.
  • 다국어 NMT 및 ASR 접근 방식을 영감으로 받아, 제로샷 번역과 언어 간 파rameter 공유를 지원하는 공통 인코더-디코더 아키텍처를 활용한다.
  • 특히 저자원 환경에서의 정렬 및 학습 안정성을 향상시키기 위해 인코더에 하이브리드 CTC/주의 손실을 적용한다.
Fig. 1 : System overview for the multilingual end-to-end speech translation model
Fig. 1 : System overview for the multilingual end-to-end speech translation model

실험 결과

연구 질문

  • RQ1단일 유니버설 시퀀스 투 시퀀스 모델이 다수의 원천 및 목표 언어 조합 간에 효과적으로 다국어 종단 간 음성 번역을 수행할 수 있는가?
  • RQ2일대다 및 다대다 설정에서 다국어 E2E-ST는 이중 언어 E2E-ST에 비해 번역 성능에서 어떻게 비교되는가?
  • RQ3Mboshi–프랑스어와 같은 매우 저자원 언어 조합에서 다국어 사전 학습이 제로샷 전이 성능을 얼마나 향상시키는가?
  • RQ4통합 E2E-ST 모델에서 언어 간 파rameter 공유가 파이프라인 시스템에 비해 오류 전파를 줄이고 강건성을 향상시키는가?
  • RQ5사전 지식 없이 또는 타겟 언어의 문자를 사전에 알지 못한 채로도 모델이 예상치 못한 언어 조합으로 일반화할 수 있는가?

주요 결과

  • 다국어 E2E-ST 모델은 일대다 및 다대다 번역 시나리오에서 이중 언어 모델보다 뚜렷한 성능 향상을 보이며, Mboshi–프랑스어 저자원 작업에서 BLEU 점수가 이중 언어 모델의 4.55에서 O2M 설정의 6.92로 향상되었다.
  • O2M(일대다) 다국어 모델이 Mboshi–프랑스어 테스트 세트에서 최고의 BLEU 점수 6.92를 기록했으며, M2Ma(6.52) 및 M2Mc(5.50) 설정을 모두 초월했다.
  • 이중 언어 사전 학습에 비해 다국어 사전 학습이 Mboshi–프랑스어 언어 조합에서 제로샷 전이 성능을 향상시켜, 예상치 못한 저자원 언어로의 일반화 능력 향상을 입증했다.
  • 표준 벤치마크(Fisher, LibriSpeech, TED)에서 경쟁적인 성능을 달성했으며, 다국어 학습이 E2E-ST와 파이프라인 시스템 간 격차를 줄였다.
  • 모든 설정에서 BPE에 비해 문자 수준 단위 사용이 더 우수한 성능을 보였으며, 특히 저자원 환경에서 데이터 희소성 문제를 더 잘 다루었다.
  • 언어 식별 또는 별도의 텍스트 정규화 없이도 제로샷 번역을 성공적으로 구현하여 파이프라인을 단순화하고 오류 전파를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.