Skip to main content
QUICK REVIEW

[논문 리뷰] Mu$^{2}$SLAM: Multitask, Multilingual Speech and Language Models

Yong Cheng, Yu Zhang|arXiv (Cornell University)|2022. 12. 19.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

Mu²SLAM은 100개 이상의 언어에서 라벨이 없는 음성, 라벨이 없는 텍스트, 그리고 감독된 ASR, AST, MT 데이터를 함께 사전 훈련한 통합 다국어 다중 작업 순서-순서 모델을 소개한다. 공유된 인코더-디코더 아키텍처를 사용하고, 마스크된 노이즈 제거 및 마스크된 언어 모델링 목적함수를 적용함으로써 CoVoST에서 SOTA 성능을 달성하며, xx-en에서 1.9 BLEU 향상, en-xx에서 1.1 BLEU 향상되었고, mT5와 유사한 텍스트 벤치마크(XNLI 및 TydiQA)에서 성능 격차를 줄였다.

ABSTRACT

We present Mu$^{2}$SLAM, a multilingual sequence-to-sequence model pre-trained jointly on unlabeled speech, unlabeled text and supervised data spanning Automatic Speech Recognition (ASR), Automatic Speech Translation (AST) and Machine Translation (MT), in over 100 languages. By leveraging a quantized representation of speech as a target, Mu$^{2}$SLAM trains the speech-text models with a sequence-to-sequence masked denoising objective similar to T5 on the decoder and a masked language modeling (MLM) objective on the encoder, for both unlabeled speech and text, while utilizing the supervised tasks to improve cross-lingual and cross-modal representation alignment within the model. On CoVoST AST, Mu$^{2}$SLAM establishes a new state-of-the-art for models trained on public datasets, improving on xx-en translation over the previous best by 1.9 BLEU points and on en-xx translation by 1.1 BLEU points. On Voxpopuli ASR, our model matches the performance of an mSLAM model fine-tuned with an RNN-T decoder, despite using a relatively weaker sequence-to-sequence architecture. On text understanding tasks, our model improves by more than 6\% over mSLAM on XNLI, getting closer to the performance of mT5 models of comparable capacity on XNLI and TydiQA, paving the way towards a single model for all speech and text understanding tasks.

연구 동기 및 목표

  • 다양한 모odal과 작업에서 함께 학습하는 통합 다국어 음성 및 텍스트 모델을 개발하여, 모odal 전용 구성 요소 없이 학습하도록 한다.
  • 이전 모델들이 음성과 텍스트를 별도로 처리하거나 모달 전용 헤드를 사용함으로써 표현 공유를 약화시키는 한계를 해결한다.
  • 라벨이 없는 데이터와 라벨이 있는 데이터를 모두 활용한 다중 작업 사전 훈련을 통해 다국어 및 다중 모달 표현 정렬을 향상시킨다.
  • 새로운 미세조정 전략(점진적 및 노이즈가 있는 미세조정)을 통해 사전 훈련 및 미세조정 간 분포 이질성 감소를 통해 최종 작업 성능을 향상시킨다.
  • XTREME와 같은 다국어 NLU 벤치마크에서 음성-텍스트 모델과 순수 텍스트 모델 간의 성능 격차를 줄인다.

제안 방법

  • 100개 이상의 언어에서, 라벨이 없는 음성, 라벨이 없는 텍스트, 감독된 ASR, AST, MT 데이터를 사용하여 단일 인코더-디코더 모델을 사전 훈련한다.
  • 음성 및 텍스트 입력 모두에 대해 인코더에서 마스크된 언어 모델링(MLM) 목적함수를 적용하고, 디코더에 T5 스타일의 노이즈 제거 목적함수를 적용한다.
  • 라벨이 없는 데이터와 라벨이 있는 데이터 모두에 동일한 손실 함수를 사용하여 아키텍처의 복잡성을 최소화하고 표현 공유를 촉진한다.
  • 모달 전용 인코더를 피하기 위해 음성 표현 추출을 위한 단일 CNN 블록을 사용하여 모달 간 학습을 강제한다.
  • 사전 훈련 데이터로 라벨이 있는 데이터를 계속 사전 훈련한 후에 작업 전용 미세조정을 수행함으로써 점진적 미세조정을 구현하여 분포 이질성을 감소시킨다.
  • 미세조정 중에 디코더 입력을 교란함으로써 노이즈가 있는 미세조정을 적용하여 음성 번역 작업에서의 강인성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1통합 순서-순서 모델이 100개 이상의 언어에서 음성 및 텍스트 데이터를 함께 사전 훈련하여 음성 및 텍스트 작업 모두에서 뛰어난 성능을 달성할 수 있는가?
  • RQ2MLM, 노이즈 제거, 정렬을 포함한 다중 작업 목적함수를 통한 공동 사전 훈련이 다국어 및 다중 모달 표현 학습을 어떻게 향상시키는가?
  • RQ3점진적 및 노이즈가 있는 미세조정 전략이 사전 훈련과 미세조정 간 격차를 어느 정도 감소시키며, 최종 작업 성능을 향상시키는가?
  • RQ4ASR 및 AST 벤치마크에서 통합 모델이 전용 모델(mSLAM with RNN-T 등)과 비교해 어떻게 성능을 내는가?
  • RQ5다국어 NLU 벤치마크에서 강력한 순수 텍스트 모델(mT5 등)과의 성능 격차를 통합 모델이 줄일 수 있는가?

주요 결과

  • Mu²SLAM은 다국어 음성 번역에서 CoVoST에서 새로운 SOTA 성능을 달성하여, 이전 공개 모델 대비 xx-en에서 1.9 BLEU 포인트 향상되고 en-xx에서 1.1 BLEU 포인트 향상되었다.
  • Voxpopuli ASR 벤치마크에서 Mu²SLAM은 더 약한 Transformer 디코더를 사용함에도 불구하고, RNN-T 디코더로 미세조정된 mSLAM 모델과 성능이 유사했다.
  • XNLI 벤치마크에서 Mu²SLAM은 mSLAM보다 6% 이상 향상되었고, 유사 크기의 mT5 모델에 가까워졌다.
  • TydiQA에서 Mu²SLAM은 유사 능력의 mT5 모델과 유사한 성능을 달성하여 강력한 다국어 텍스트 이해 능력을 보였다.
  • 제거 분석 결과, 사전 훈련에 ASR 및 AST 데이터를 포함시키면 AST 성능이 크게 향상되며, 특히 자원이 적은 언어 쌍에서 두드러졌다.
  • 노이즈가 있는 미세조정은 모든 번역 방향에서 성능 향상을 가져왔고, 최적의 노이즈 비율은 언어 쌍에 따라 달라져 방향별 강인성 향상 이점을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.