[논문 리뷰] Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
이 논문은 음성 단위를 공통 이산 표현으로 사용하여 다국어 음성과 텍스트 표현을 하나의 모델로 학습하는 통합 프레임워크인 유닛 간 번역(UTUT)을 제안한다. 원천 언어와 대상 언어 토큰에 조건을 줌으로써 UTUT은 다대다 음성 간 음성 번역을 가능하게 하며, 텍스트 없이도 텍스트 간 음성 합성(TTS)과 텍스트 간 음성 번역(TTST)으로 효과적으로 전이되며, 사전에 학습되지 않은 언어 조합 간의 제로샷 번역을 포함해 최신 기술 수준의 성능을 달성한다.
This paper proposes a textless training method for many-to-many multilingual speech-to-speech translation that can also benefit the transfer of pre-trained knowledge to text-based systems, text-to-speech synthesis and text-to-speech translation. To this end, we represent multilingual speech with speech units that are the discretized representations of speech features derived from a self-supervised speech model. By treating the speech units as pseudo-text, we can focus on the linguistic content of the speech, which can be easily associated with both speech and text modalities at the phonetic level information. By setting both the inputs and outputs of our learning problem as speech units, we propose to train an encoder-decoder model in a many-to-many spoken language translation setting, namely Unit-to-Unit Translation (UTUT). Specifically, the encoder is conditioned on the source language token to correctly understand the input spoken language, while the decoder is conditioned on the target language token to generate the translated speech in the target language. Therefore, during the training, the model can build the knowledge of how languages are comprehended and how to relate them to different languages. Since speech units can be easily associated from both audio and text by quantization and phonemization respectively, the trained model can easily transferred to text-related tasks, even if it is trained in a textless manner. We demonstrate that the proposed UTUT model can be effectively utilized not only for Speech-to-Speech Translation (S2ST) but also for multilingual Text-to-Speech Synthesis (T2S) and Text-to-Speech Translation (T2ST), requiring only minimal fine-tuning steps on text inputs. By conducting comprehensive experiments encompassing various languages, we validate the efficacy of the proposed method across diverse multilingual tasks.
연구 동기 및 목표
- 음성의 연속적이고 발화자에 따라 달라지는 특성으로 인해 어려운 문제를 해결하면서도, 하나의 모델을 사용해 음성과 텍스트의 통합된 다국어 표현을 학습하는 것.
- 단일 사전 학습 모델을 사용해 다양한 언어 간 다대다 구두 언어 번역을 가능하게 하는 것.
- 사전 학습 단계에서 텍스트를 요구하지 않고도 텍스트 기반 작업, 예를 들어 TTS와 TTST에 사전 학습 모델을 전이할 수 있도록 하는 것.
- 음성 단위가 종단 간 다국어 처리를 위한 실용적인 다리 역할을 할 수 있는지 탐색하는 것.
- UTUT의 효과성을 다양한 다국어 작업, 특히 사전에 학습되지 않은 언어 조합 간 제로샷 번역을 포함해 검증하는 것.
제안 방법
- 다양한 언어의 음성 오디오가 자기학습 음성 표현의 양자화를 통해 이산 음성 단위로 변환된다 (예: HuBERT).
- 모델은 음성 단위 토큰으로 구성된 입력 및 출력 시퀀스를 사용하는 순서 기반 인코더-디코더 아키텍처를 사용한다.
- UTUT 목적함수는 인코더에 원천 언어 토큰을 조건으로 하고 디코더에 대상 언어 토큰을 조건으로 하여 다국어 간 번역을 가능하게 한다.
- 모델는 음성 단위의 마스크된 예측 목적함수를 사용해 다국어 음성 단위 데이터로 사전 학습되며, 다양한 언어 간 음성 단위의 재구성과 번역을 학습한다.
- 사전 학습 후, 음성 단위와 텍스트 간 통합 표현 공간을 활용해 텍스트 입력으로 미세조정할 수 있으며, 이로써 텍스트 간 음성 합성과 텍스트 간 음성 번역이 가능해진다.
- 유닛 공간 내 공통 다국어 표현을 활용해, 학습 중에 볼 수 없었던 언어 조합 간 제로샷 번역을 지원한다.
실험 결과
연구 질문
- RQ1단일 모델이 공통 입력 형식으로 음성 단위만을 사용해 음성과 텍스트의 통합된 다국어 표현을 학습할 수 있는가?
- RQ2제안된 UTUT 프레임워크가 학습 중에 볼 수 없었던 언어 조합을 포함해 다양한 언어 조합 간 다대다 음성 간 음성 번역을 가능하게 할 수 있는가?
- RQ3음성 단위로 사전 학습하고 UTUT 목적함수를 사용하면, 사전 학습 단계에서 텍스트가 필요 없이도 TTS와 TTST와 같은 텍스트 기반 후행 작업으로 효과적으로 전이될 수 있는가?
- RQ4UTUT의 성능는 기존의 다국어 TTS 및 STS 시스템과 비교해 어떻게 되는가? 특히 제로샷 설정에서의 성능는 어떠한가?
- RQ5입력 마스킹이 UTUT 사전 학습에 유익한가? 이는 자동회귀 언어 모델링에서처럼 작용하는가?
주요 결과
- UTUT는 6개 언어(En, Es, Fr, It, De, Nl)에서 평균 관점 평가 점수(MOS) 4.44를 기록하며, 텍스트 없이 사전 학습된 점을 감안할 때 기존 최신 기술 수준의 다국어 TTS 시스템인 YourTTS와 LAML을 초월한다.
- 텍스트 간 음성 번역(TTST)에서의 BLEU 점수는 자체 음성 간 음성 번역(STS) 성능과 유사하여, 음성 모odal로부터 텍스트 모달로의 효과적인 전이가 이루어졌음을 확인한다.
- UTUT는 사전에 학습되지 않은 언어 조합 간 제로샷 번역을 성공적으로 수행했으며, Pt-Es, Pt-Fr, Pt-It, Pt-De, Pt-Nl 등 다양한 조합을 포함해 강력한 다국어 일반화 능력을 보였다.
- 제거 실험 결과, 사전 학습 중 입력 마스킹이 UTUT 성능을 향상시키지 못함을 확인했다. 마스킹 비율 0% 조건이 항상 다른 조건보다 우수했으며, 이는 이 설정에서 복원보다 다국어 정렬이 더 중요하다는 것을 시사한다.
- 문자 오류율(CER) 평가 결과, 텍스트에서 생성된 UTUT의 음성은 참값 음성 단위에서 재합성된 음성보다 더 명확하게 듣기 쉬웠다. 이는 모델이 원본 오디오에 존재하는 노이즈와 잡음을 효과적으로 억제할 수 있음을 의미한다.
- UTUT 모델는 mBART가 8만 시간 분량의 영어 및 스페인어 데이터로 사전 학습된 점을 감안할 때도, Voxpopuli 데이터에 대해 미세조정된 mBART보다 더 뛰어난 STS 성능을 기록했다. 이는 UTUT 사전 학습 목적함수가 효과적이라는 것을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.