Skip to main content
QUICK REVIEW

[논문 리뷰] Fused Acoustic and Text Encoding for Multimodal Bilingual Pretraining and Speech Translation

Renjie Zheng, Junkun Chen|arXiv (Cornell University)|2021. 02. 10.
Speech Recognition and Synthesis인용 수 12
한 줄 요약

이 논문은 다양한 데이터 소스—단일어, 음성 인식, 기계 번역 코퍼스를 포함—에서 음성과 텍스트를 동시에 인코딩하는 통합 표현 학습 프레임워크인 Fused Acoustic and Text Masked Language Modeling (FAT-MLM)을 제안한다. FAT-MLM로 미세조정된 엔드투엔드 Fused Acoustic and Text Speech Translation (FAT-ST) 모델은 세 언어 쌍에서 BLEU 점수를 최대 +5.9 향상시키며 최신 기준 성능을 달성했으며, 더 빠른 추론 속도와 더 작은 모델 크기로 캐스케이드 시스템을 능가한다.

ABSTRACT

Recently, representation learning for text and speech has successfully improved many language related tasks. However, all existing methods suffer from two limitations: (a) they only learn from one input modality, while a unified representation for both speech and text is needed by tasks such as end-to-end speech translation, and as a result,(b) they can not exploit various large-scale text and speech data and their performance is limited by the scarcity of parallel speech translation data.To address these problems, we propose a Fused Acoustic and Text Masked Language Model (FAT-MLM) which jointly learns a unified representation for both acoustic and text input from various types of corpora including parallel data for speech recognition and machine translation, and even pure speech and text data. Within this cross-modal representation learning framework, we further present an end-to-end model for Fused Acoustic and Text Speech Translation (FAT-ST). Experiments on three translation directions show that by fine-tuning from FAT-MLM, our proposed speech translation models substantially improve translation quality by up to +5.9 BLEU.

연구 동기 및 목표

  • 기존 사전학습 방법이 하나의 모odal(음성 또는 텍스트)만 처리하는 데에 한계가 있다는 점을 해결하기 위해, 양방향 모달을 위한 통합 표현 학습 프레임워크를 제안한다.
  • 비교적 희소한 병렬 음성 번역 데이터의 부족을 보완하기 위해, 풍부한 단일어 텍스트, 음성 인식, 기계 번역 데이터를 활용한다.
  • 공유된 인코더-디코더 아키텍처를 통해 다양한 사전학습 데이터로부터 엔드투엔드 음성 번역 모델이 이점을 얻을 수 있도록 한다.
  • 캐스케이드 시스템에 비해 낮은 지연 시간과 더 작은 모델 크기를 유지하면서도 엔드투엔드 음성 번역에서 최신 기준 성능을 달성한다.

제안 방법

  • FAT-MLM는 다양한 코퍼스에서 유도된 혼합된 음성과 텍스트 입력에 대해 마스킹된 언어 모델링을 통해 통합 인코더를 공동으로 사전학습한다. 이 코퍼스에는 병렬 음성 번역, 음성 인식, 기계 번역 데이터가 포함된다.
  • 모델은 음성 특징과 텍스트 임베딩을 모두 처리하기 위해 공유된 Transformer 기반 인코더를 사용하며, 양방향 모달에 대해 마스킹 예측 목표를 설정한다.
  • FAT-MLM 인코더 위에 순차적-순차적 Fused Acoustic and Text Speech Translation (FAT-ST) 모델을 구축하여 음성 인식과 번역의 공동 학습을 가능하게 한다.
  • FAT-ST 모델은 마스킹된 음성 모델링, 마스킹된 텍스트 모델링, 순차적-순차적 번역 손실이라는 다중 목표로 훈련된다.
  • 추가로 단일어 음성과 텍스트 데이터에 대한 사전학습을 통해 일반화 능력과 성능이 향상된다.
  • 공유된 파rameter를 통한 엔드투엔드 훈련을 지원함으로써 캐스케이드 시스템에 비해 더 빠른 추론과 더 적은 오류 전파를 달성한다.

실험 결과

연구 질문

  • RQ1다양한 유형의 데이터(단일어, 음성 인식, 기계 번역 등)에서 음성과 텍스트 입력을 동시에 효과적으로 학습할 수 있는 통합 표현 모델이 가능한가?
  • RQ2희소한 병렬 음성 번역 데이터가 아닌 이질적인 음성과 텍스트 데이터를 공동으로 사전학습하면, 엔드투엔드 음성 번역 성능이 향상되는가?
  • RQ3제안된 FAT-MLM 프레임워크를 통해 하나의 엔드투엔드 모델이 경쟁력 있는 품질과 속도로 음성 인식과 번역을 동시에 수행할 수 있는가?
  • RQ4비병렬 데이터(예: 단일어 텍스트 및 음성)에 대한 추가 사전학습이 최종 음성 번역 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 FAT-ST 모델은 낮은 지연 시간과 더 작은 모델 크기를 유지하면서도 강력한 캐스케이드 시스템과 유사한 성능을 달성하는가?

주요 결과

  • FAT-MLM에서 미세조정된 FAT-ST는 Must-C 데이터셋에서 세 번역 방향 모두에서 기준 모델 대비 +5.9 BLEU 점수 향상을 기록했다.
  • 영어-독일어, 영어-프랑스어, 영어-중국어 음성 번역에서 최신 기준 성능을 달성했으며, 강력한 캐스케이드 기반 기준 모델을 능가했다.
  • 추가로 단일어 음성과 텍스트 데이터에 대한 사전학습을 통합함으로써 FAT-ST는 추가로 +1.25 BLEU 향상을 기록했으며, 데이터 효율성의 이점이 입증되었다.
  • 캐스케이드 시스템 대비 디코딩 속도가 약 2배 빠르며, 별도의 ASR 모듈 대기 시간이 없기 때문이다.
  • 제거 실험 결과, FAT-MLM 사전학습, 공유 인코더, 다중 목표 훈련 모두 성능 향상에 기여하는 것으로 확인되었다.
  • 영어-중국어 작업에서 FAT-ST는 25.49의 문자 수준 BLEU 점수를 기록했으며, 이는 이전 모델인 ST* (22.07) 및 캐스케이드 시스템 (21.36)을 모두 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.