[논문 리뷰] Multilingual Speech-to-Speech Translation into Multiple Target Languages
이 논문은 다국어 음성-음성 번역 시스템을 처음으로 제안하며, 다국어 음성-마스크드유닛(S2MU) 모델과 언어별 유닛 마스킹, 언어 임bedding과 보조 언어 식별 손실을 갖춘 다국어 보이스터를 사용하여 다수의 목표 언어를 지원한다. 이 방법은 도메인 내 데이터에서 이중어 모델 대비 평균 +5.2 BLEU 향상을 달성하고, 도메인 외부 데이터에서는 +2.7 향상되며, 영어를 16개의 목표 언어로 번역할 때 성능을 발휘한다.
Speech-to-speech translation (S2ST) enables spoken communication between people talking in different languages. Despite a few studies on multilingual S2ST, their focus is the multilinguality on the source side, i.e., the translation from multiple source languages to one target language. We present the first work on multilingual S2ST supporting multiple target languages. Leveraging recent advance in direct S2ST with speech-to-unit and vocoder, we equip these key components with multilingual capability. Speech-to-masked-unit (S2MU) is the multilingual extension of S2U, which applies masking to units which don't belong to the given target language to reduce the language interference. We also propose multilingual vocoder which is trained with language embedding and the auxiliary loss of language identification. On benchmark translation testsets, our proposed multilingual model shows superior performance than bilingual models in the translation from English into $16$ target languages.
연구 동기 및 목표
- 다국어 음성-음성 번역을 가능하게 하여 다국어 소스에만 국한된 이전 연구를 넘어 다국어 목표 언어를 지원하는 것.
- 단일 S2ST 모델에 다수의 언어를 통합할 때 발생하는 언어 간 간섭과 단위 어휘 크기 증가 문제를 해결하는 것.
- 언어 임bedding과 보조 언어 식별 손실을 갖춘 다국어 보이스터를 도입하여 확장성과 성능을 향상시키는 것.
- 특히 자원이 적은 언어에 유리하게 다국어 모델링을 통해 지식 전이를 가능하게 하는 것.
제안 방법
- 목표 언어에 속하지 않는 단위에 대해 마스킹을 적용하는 음성-마스크드유닛(S2MU) 모델을 제안하여 번역 과정에서의 다국어 간 간섭을 줄인다.
- 언어 임bedding과 언어 식별을 위한 보조 손실을 사용해 훈련된 다국어 보이스터를 도입하여 목표 언어 간 일반화 능력을 향상시킨다.
- 목표 음성에서 이산 단위를 추출하기 위해 사전 훈련된 HuBERT 모델을 사용하며, 다국어 모델링을 위해 언어 간 단위 사전을 연결한다.
- 마스킹된 단위를 사용해 S2U 모델을 엔드 투 엔드로 훈련하여 번역 과정에서 관련 언어별 단위에 집중하도록 한다.
- 이중 훈련 파이프라인을 적용: 먼저 마스킹된 단위로 S2MU를 훈련하고, 그 다음 예측된 단위와 언어 식별자로 다국어 보이스터를 훈련한다.
- 평가 지표로 ASR-BLEU를 사용하며, 생성된 음성을 사전 훈련된 ASR 모델로 인식하고 기준 텍스트와 비교한다.

실험 결과
연구 질문
- RQ1단일 다국어 모델이 다국어 소스뿐만 아니라 다국어 목표 언어를 효과적으로 지원할 수 있는가?
- RQ2공유된 S2U 모델에 다국어 단위 어휘를 통합할 때 언어 간 간섭을 어떻게 줄일 수 있는가?
- RQ3언어 임bedding과 보조 언어 식별 손실을 사용해 훈련된 다국어 보이스터가 다양한 목표 언어 간 음성 합성 품질과 번역 성능을 향상시킬 수 있는가?
- RQ4다국어 S2ST에서의 언어 간 지식 전이가 성능 향상에 기여하는가, 특히 자원이 적은 환경에서 유의미한가?
- RQ5모델 용량(예: S2U 대 Textless)과 언어 자원 가용성 간의 상호작용이 번역 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 다국어 S2ST 모델은 16개의 목표 언어에서 도메인 내 테스트 세트에서 이중어 S2U 모델 대비 평균 +5.2 BLEU 향상을 달성한다.
- 도메인 외부 데이터에서는 이중어 기준 모델 대비 평균 +2.7 BLEU 향상되며, 도메인 이동에 대한 강건성을 입증한다.
- S2MU 모델과 다국어 보이스터를 결합한 모델은 도메인 내 및 도메인 외부 세트에서 각각 +1.1 및 +1.6 BLEU 향상으로 이중어 Textless 모델을 능가한다.
- 다국어 보이스터는 재합성 과정에서 WER를 감소시켜 번역 성능을 향상시키며, 특히 en-es와 같은 고자원 방향에서 가장 두드러진 성과를 보이며, S2MU를 사용할 경우 BLEU가 +2.0 향상된다.
- 다국어 모델의 성능은 S2MU 추론 품질과 강하게 상관되어 있으며, 스로바크어(sk)처럼 낮은 품질의 단위를 사용하는 언어는 WER가 5% 감소하지만 BLEU 향상은 제한적이다.
- 에스토니아어(et), 핀란드어(fi), 리투아니아어(lt)와 같은 저자원 방향에서는 모든 모델이 열악한 성능을 보이며, 다국어 훈련에도 불구하고 데이터 부족이 여전히 주요 장벽임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.