Skip to main content
QUICK REVIEW

[논문 리뷰] MAM: Masked Acoustic Modeling for End-to-End Speech-to-Text Translation

Junkun Chen, Mingbo Ma|arXiv (Cornell University)|2020. 10. 22.
Natural Language Processing Techniques참고 문헌 41인용 수 14
한 줄 요약

이 논문은 음성 데이터의 번역이 필요한 전사된 음성 데이터에 의존하지 않고도 엔드 투 엔드 음성-텍스트 번역(E2E-ST)을 가능하게 하는 자기지도 학습 사전 훈련 기법인 마스킹 음성 모델링(MAM)을 제안한다. MAM은 문맥 정보를 활용해 마스킹된 음성 세그먼트를 재구성하도록 음성 인코더를 훈련시키며, 전사 자료 없이도 기준 모델 대비 평균 +2.3 BLEU 향상을 달성한다. 또한 음악이나 동물 울음과 같은 비음성 음향 자료로도 사전 훈련을 수행할 경우 성능 향상이 이루어지며, 이는 일반화 능력을 보여준다.

ABSTRACT

End-to-end Speech-to-text Translation (E2E-ST), which directly translates source language speech to target language text, is widely useful in practice, but traditional cascaded approaches (ASR+MT) often suffer from error propagation in the pipeline. On the other hand, existing end-to-end solutions heavily depend on the source language transcriptions for pre-training or multi-task training with Automatic Speech Recognition (ASR). We instead propose a simple technique to learn a robust speech encoder in a self-supervised fashion only on the speech side, which can utilize speech data without transcription. This technique termed Masked Acoustic Modeling (MAM), not only provides an alternative solution to improving E2E-ST, but also can perform pre-training on any acoustic signals (including non-speech ones) without annotation. We conduct our experiments over 8 different translation directions. In the setting without using any transcriptions, our technique achieves an average improvement of +1.1 BLEU, and +2.3 BLEU with MAM pre-training. Pre-training of MAM with arbitrary acoustic signals also has an average improvement with +1.6 BLEU for those languages. Compared with ASR multi-task learning solution, which replies on transcription during training, our pre-trained MAM model, which does not use transcription, achieves similar accuracy.

연구 동기 및 목표

  • 기존 엔드 투 엔드 음성-텍스트 번역(E2E-ST) 모델이 사전 훈련 또는 다중 작업 학습을 위해 대규모 전사된 음성 데이터에 의존하는 문제를 해결하기 위해.
  • 원시적이고 전사되지 않은 음성 및 임의의 음향 신호(예: 음악, 동물 울음)를 활용해 강력한 음성 인코더를 사전 훈련하기 위한 자기지도 학습 방법을 개발하기 위해.
  • 전사 자료 없이 사전 훈련한 모델이 ASR 다중 작업 학습과 같은 전사 의존적 방법과 동일하거나 이를 초월하는 성능을 달성할 수 있음을 입증하기 위해.
  • 전사 자료가 없거나 매우 비용이 많이 드는 저자원 및 제로 자원 환경에서 효과적인 사전 훈련을 가능하게 하기 위해.

제안 방법

  • 사전 훈련 중 입력 음성 스펙트로그램의 무작위 세그먼트를 마스킹하고, 문맥 정보를 사용해 원래 마스킹된 세그먼트를 재구성하도록 모델을 훈련한다.
  • 재구성 목표는 텍스트나 전사 자료의 지도 없이도 음성 모odal리티에만 적용된다.
  • 사전 훈련된 MAM 모델은 추가로 전사된 데이터로의 미세 조정 없이도 엔드 투 엔드로 음성-텍스트 번역에 대해 미세 조정할 수 있다.
  • MAM은 어떤 E2E-ST 모델 아키텍처와도 호환되며, 기존의 사전 훈련 또는 다중 작업 학습 전략과도 조합할 수 있다.
  • 이 방법은 일반화 가능하다: 인간의 음성 외에도 다국어 음성, 음악, 동물 발성 등 임의의 음향 신호로도 사전 훈련이 가능하다.
  • 모델은 표준 순서-순서 프레임워크를 사용하며, 예측된 마스킹된 음성 프레임과 원래 프레임 간의 MSE 손실을 최소화하는 마스킹 재구성 목표를 적용한다.

실험 결과

연구 질문

  • RQ1전사 자료가 필요 없는 자기지도 학습 음성 사전 훈련 방법이 엔드 투 엔드 음성-텍스트 번역 성능을 향상시킬 수 있는가?
  • RQ2MAM 사전 훈련이 음악이나 동물 울음과 같은 비음성 음향 신호로까지 일반화될 수 있는가?
  • RQ3번역 정확도 측면에서 MAM은 전사 의존적 사전 훈련(예: ASR 사전 훈련 또는 MTL)과 어떻게 비교되는가?
  • RQ4전사 자료가 전혀 없는 저자원 또는 제로 자원 환경에서 MAM이 강력한 성능을 달성할 수 있는가?
  • RQ5MAM 사전 훈련이 비용이 많이 드는 전사 자료의 필요성을 줄이면서도 번역 품질을 유지하거나 향상시킬 수 있는가?

주요 결과

  • 전사 자료가 없는 제로 전사 설정에서, MAM은 8개 번역 방향에 걸쳐 기준 모델 대비 평균 +1.09 BLEU 향상을 달성한다.
  • MAM 사전 훈련을 통해 모델은 전사 자료 없이도 평균 +2.26 BLEU 향상을 달성하며, 이는 기준 모델보다 유의미하게 뛰어난 성능을 보인다.
  • 임의의 음향 신호(예: 음악, 동물 발성)로 사전 훈련한 경우에도 MAM은 평균 +1.6 BLEU 향상을 달성하여 인간의 음성 외로도 일반화 가능함을 입증한다.
  • 저자원 설정(50시간의 훈련 데이터)에서, 전사 자료 없이 Libri-Light에서 사전 훈련한 MAM은 ASR 다중 작업 학습으로 미세 조정한 모델과 유사한 성능을 보인다.
  • 단지 50시간의 훈련 데이터와 번역 자료 없이도, 비음성 음향 자료로 사전 훈련한 MAM은 프랑스어-영어 번역에서 6.84 BLEU를 기록하며, 기준 E2E-ST 모델(0.52 BLEU)을 뛰어넘는다.
  • 영어 데이터로 사전 훈련한 MAM은 영어-프랑스어 번역에서 기준 모델(28.9) 대비 31.2 BLEU로 성능 향상을 보이며, 최소한의 지도 정보로도 강력한 성과를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.