Skip to main content
QUICK REVIEW

[논문 리뷰] Translatotron 3: Speech to Speech Translation with Monolingual Data

Eliya Nachmani, Alon Levkovitch|arXiv (Cornell University)|2023. 05. 27.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

Translatotron 3는 쌍방향 번역 데이터가 없이도 완전히 비지도 학습된 엔드 투 엔드 음성-음성 번역 모델을 제안하며, 마스크된 오토인코딩, 다국어 비지도 임베딩 매핑(MUSE), 백번역 기법을 활용해 단말어 음성-텍스트 데이터셋에서 학습한다. 이는 캐스케이드 기반 모델 대비 18.14 BLEU 향상도를 달성했고, 말하는 속도, 화자 신원 등 언어적·비언어적 특징을 별도의 쌍방향 데이터 없이도 유지한다.

ABSTRACT

This paper presents Translatotron 3, a novel approach to unsupervised direct speech-to-speech translation from monolingual speech-text datasets by combining masked autoencoder, unsupervised embedding mapping, and back-translation. Experimental results in speech-to-speech translation tasks between Spanish and English show that Translatotron 3 outperforms a baseline cascade system, reporting $18.14$ BLEU points improvement on the synthesized Unpaired-Conversational dataset. In contrast to supervised approaches that necessitate real paired data, or specialized modeling to replicate para-/non-linguistic information such as pauses, speaking rates, and speaker identity, Translatotron 3 showcases its capability to retain it. Audio samples can be found at http://google-research.github.io/lingvo-lab/translatotron3

연구 동기 및 목표

  • 쌍방향 음성 데이터가 전혀 필요 없는 엔드 투 엔드 비지도 음성-음성 번역 시스템을 개발하는 것.
  • 번역 과정에서 말하는 속도, 휴식, 화자 신원 등의 비언어적 특징을 명시적 지도 없이 유지하는 것.
  • 비지도 캐스케이드 기반 모델 대비 성능을 향상시키고, 단지 단말어 데이터셋을 사용해 지도 학습 기반 S2ST 모델에 근접하는 것.
  • 마스크된 오토인코딩, 비지도 임베딩 매핑, 백번역 기법을 통합된 학습 프레임워크에서 효과적으로 조합하는 방법의 유용성을 입증하는 것.

제안 방법

  • 모델은 공통 인코더와 두 개의 디코더(각 언어별로 하나씩)를 사용하며, 두 단계로 학습한다: 첫 번째 단계에서는 SpecAugment를 적용한 마스크된 오토인코더로 학습하고, 두 번째 단계에서는 백번역 기반 학습을 수행한다.
  • 쌍방향 데이터 없이도 다국어 표현 간의 정렬을 가능하게 하기 위해 비지도 다국어 임베딩 매핑(MUSE)을 활용한다.
  • 재구성 손실은 첫 번째 단계의 오토인코딩과 두 번째 단계의 백번역을 통해 모두 적용되어 언어 간 일관성을 강화한다.
  • 학습 목표는 인코더 출력에서의 MUSE 손실, 마스크된 오토인코딩에서의 재구성 손실, 그리고 언어 간 정렬을 위한 백번역 손실을 통합한다.
  • 모델은 병렬 음성 문장이 전혀 필요 없이 오직 단말어 음성 및 텍스트 데이터셋에서만 학습된다.
  • 추론 과정에서는 공통 인코더가 입력 음성을 다국어 임베딩 공간으로 인코딩하고, 이는 대상 언어에 특화된 디코더에 의해 디코딩된다.

실험 결과

연구 질문

  • RQ1완전히 비지도 엔드 투 엔드 S2ST 모델이 쌍방향 번역 음성 데이터 없이도 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2화자 신원, 말하는 속도 등의 비언어적 특징이 명시적 지도 없이 번역 과정에서 얼마나 잘 유지되는가?
  • RQ3마스크된 오토인코딩, MUSE 기반 임베딩 매핑, 백번역 기법이 비지도 S2ST 성능 향상에 어떻게 통합적으로 기여하는가?
  • RQ4제안된 방법이 비지도 캐스케이드 기반 모델을 초월하고, BLEU 점수와 자연스러움 측면에서 지도 학습 기반 S2ST 시스템에 근접하는가?

주요 결과

  • 합성된 Unpaired-Conversational(UC) 데이터셋에서 Translatotron 3는 캐스케이드 기반 모델 대비 18.14 BLEU 향상을 달성했다.
  • CVSS 데이터셋에서 스페인어-영어 번역 성능은 24.27 BLEU로 측정되었으며, 지도 학습 기반 모델과의 격차는 단 1.95 BLEU 점수에 불과했다.
  • UC 데이터셋에서 화자 신원 유사도 점수는 0.62를 기록했으며, 이는 무작위 화자 기반 베이스라인(0.16)에 비해 뚜렷한 우수성을 보였다.
  • 실제 음성 데이터에서는 화자 유사도 점수가 0.34로 측정되어 화자 특징의 강력한 유지가 확인되었다.
  • 제거 실험 결과 재구성 손실과 백번역 손실이 성능 향상에 가장 큰 기여를 했으며, MUSE 손실과 SpecAugment 또한 유의미한 성능 향상을 이끌었다.
  • 프로젝트 웹사이트의 정성적 분석 결과, 모델은 휴식과 말하는 속도를 잘 유지하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.