[논문 리뷰] PolyVoice: Language Models for Speech to Speech Translation
PolyVoice는 비지도 학습을 통한 이산적 의미 단위를 활용하여 음성에서 음성으로의 번역을 위한 언어 모델 기반의 새로운 프레임워크를 제안한다. 이는 디코더 중심 번역 언어 모델과 유닛 기반 음성 언어 모델을 조합하여 음성 유지 합성 기능을 제공한다. 이는 번역 정확도와 음성 품질에서 최신 기술 수준을 달성하였으며, 목표 언어의 텍스트 지도 없이도 비문자 언어에 대해서도 성능을 발휘한다.
We propose PolyVoice, a language model-based framework for speech-to-speech translation (S2ST) system. Our framework consists of two language models: a translation language model and a speech synthesis language model. We use discretized speech units, which are generated in a fully unsupervised way, and thus our framework can be used for unwritten languages. For the speech synthesis part, we adopt the existing VALL-E X approach and build a unit-based audio language model. This grants our framework the ability to preserve the voice characteristics and the speaking style of the original speech. We examine our system on Chinese $ ightarrow$ English and English $ ightarrow$ Spanish pairs. Experimental results show that our system can generate speech with high translation quality and audio quality. Speech samples are available at https://speechtranslation.github.io/polyvoice.
연구 동기 및 목표
- 번역된 목표 언어 텍스트가 필요로 하지 않는 직접적이고 종단 간(end-to-end) 음성에서 음성으로의 번역 시스템을 개발한다.
- 자기지도 학습 모델에서 유도된 완전히 비지도 학습된 이산적 음성 단위를 활용하여 비문자 언어에 대한 번역을 가능하게 한다.
- 유닛 기반 음성 언어 모델을 사용하여 합성 음성에서 화자 신원과 발화 스타일을 유지한다.
- 기존의 인코더-디코더 아키텍처와 비교하여 디코더 중심 언어 모델이 S2ST에서 어떤 성능을 발휘하는지 평가한다.
- 프롬프트 엔지니어링을 통한 다중 작업 학습을 탐색하여 번역, 음성 인식(ASR), 번역(MT), 음성 합성(TTS), 통합 번역(ST) 작업을 동시에 최적화한다.
제안 방법
- 시스템은 인코더-디코더 아키텍처를 대체하기 위해 소스 언어 의미 단위를 목표 언어 의미 단위로 번역하는 데 디코더 중심 언어 모델(U-XLM)을 사용한다.
- 의미 단위는 자기지도 학습 음성 표현 모델(e.g., mHuBERT)을 통해 완전히 비지도 방식으로 추출되며, 이는 비문자 언어의 커버리지 가능성을 보장한다.
- VALL-E X 프레임워크를 사용하여 유닛-음성(U2S) 언어 모델을 훈련시켜, 소스 음성 단위와 화자 특성을 조건으로 하여 제로샷 화자 클로닝을 가능하게 한다.
- U2S 모델은 소스 음성 단위, 목표 의미 단위, 소스 음성 특성 단위를 프롬프트로 입력받아 목표 음성 단위를 생성한다.
- 유닛 볼커는 예측된 음성 단위를 웨이브폼으로 변환하며, 억양과 화자 신원을 유지한다.
- 다양한 작업 전용 프롬프트를 사용함으로써 단일 통합 모델이 ASR, MT, ST, TTS, S2ST 데이터를 함께 훈련할 수 있도록 다중 작업 학습을 구현한다.
실험 결과
연구 질문
- RQ1디코더 중심 언어 모델이 기존의 인코더-디코더 아키텍처와 비교해 직접 음성에서 음성으로의 번역에서 뛰어난 성능을 발휘할 수 있는가?
- RQ2완전히 비지도 학습된 이산적 의미 단위가 목표 언어의 텍스트 전사 자료 없이도 비문자 언어에 대한 효과적인 S2ST를 가능하게 할 수 있는가?
- RQ3유닛 기반 음성 언어 모델이 합성 음성에서 화자 신원과 자연스러움을 어느 정도 유지할 수 있는가?
- RQ4프롬프트 엔지니어링을 통한 다중 작업 학습이 여러 음성 및 언어 작업의 성능을 어떻게 향상시키는가?
- RQ5의미 단위의 품질이 전체 S2ST 성능에 어떤 영향을 미치며, 다국어 데이터를 함께 훈련함으로써 의미 단위 품질을 향상시킬 수 있는가?
주요 결과
- 디코더 중심 아키텍처는 영어-스페인어 S2ST에서 22.0 BLEU를 기록하여 기존의 인코더-디코더 기반 베이스라인보다 3.9 BLEU 포인트 높은 성능을 달성했다.
- 스페인어 음성 합성에서 텍스트 전사 자료 없이도 ASR-BLEU가 18.3를 기록하여 비문자 언어에 대한 처리 능력을 입증했다.
- U2S 음성 합성 모델은 WER 6.40, 자연스러움 점수 3.98, ASV 점수 0.38를 기록하여 VALL-E X보다 자연스러움과 강건성 면에서 뛰어난 성능을 보였다.
- 지속 시간 모델을 제거하면 WER가 31.93로 증가하여, 비지도 단위에서 고유한 지속 시간 정보가 없을 경우 지속 시간 모델이 필수적임을 시사한다.
- 다국어 mHuBERT(zh_en)를 사용한 의미 단위 추출은 WER를 4.76으로 낮추었으며, 이는 더 큰 다국어 모델이 의미 단위 품질을 향상시킬 수 있음을 시사한다.
- 공유 프롬프트를 사용한 다중 작업 학습은 S2ST BLEU를 29.4로, MT BLEU를 33.81로 향상시켜 다중 작업 통합 모델링의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.