[논문 리뷰] Translatotron 2: Robust direct speech-to-speech translation.
Translatotron 2는 번역 품질과 음성 자연스러움을 향상시키면서도 과도한 생성 아티팩트인 말장난과 정지 현상을 줄이는 엔드 투 엔드 신경망 음성-음성 번역 모델이다. 음성 인코더, 음소 디코더, 멜스펙트로그램 합성기 및 어텐션 메커니즘을 통합하며, 생산 환경에서의 오용을 방지하기 위해 원본 화자 음성 유지 기능을 도입하여 강건성을 향상시킨다.
We present Translatotron 2, a neural direct speech-to-speech translation model that can be trained end-to-end. Translatotron 2 consists of a speech encoder, a phoneme decoder, a mel-spectrogram synthesizer, and an attention module that connects all the previous three components. Experimental results suggest that Translatotron 2 outperforms the original Translatotron by a large margin in terms of translation quality and predicted speech naturalness, and drastically improves the robustness of the predicted speech by mitigating over-generation, such as babbling or long pause. We also propose a new method for retaining the source speaker's voice in the translated speech. The trained model is restricted to retain the source speaker's voice, and unlike the original Translatotron, it is not able to generate speech in a different speaker's voice, making the model more robust for production deployment, by mitigating potential misuse for creating spoofing audio artifacts. When the new method is used together with a simple concatenation-based data augmentation, the trained Translatotron 2 model is able to retain each speaker's voice for input with speaker turns.
연구 동기 및 목표
- 기존 모델보다 뛰어난 성능을 내는 더 강건하고 자연스러운 엔드 투 엔드 음성-음성 번역 시스템을 개발하기 위해.
- 합성된 음성에서 말장난과 긴 정지와 같은 과도한 생성 문제를 완화하기 위해.
- 번역된 출력에서 원본 화자 음성을 유지하여 진정성 향상과 위조 위험 감소를 위해.
- 원본 화자 음성으로만 음성 합성을 제한함으로써 생산 환경에의 구현 가능성을 확보하기 위해.
- 데이터 증강과 결합된 새로운 음성 유지 방법을 통해 모델의 강건성을 향상시키기 위해.
제안 방법
- 모델 아키텍처는 음성 인코더, 음소 디코더, 멜스펙트로그램 합성기 및 모든 구성 요소를 연결하는 어텐션 모듈을 통합한다.
- 새로운 음성 유지 메커니즘이 번역된 음성이 원본 화자 음성 특성을 유지하도록 보장한다.
- 다른 화자 음성으로의 생성을 방지하는 제약 조건을 적용하여 모델을 엔드 투 엔드로 훈련시킨다.
- 다중 화자 입력에서 화자 전환 처리를 향상시키기 위해 연결 기반 데이터 증강 기법을 적용한다.
- 어텐션 모듈이 음성 인코더 출력과 음소 디코더 및 합성기 간의 동적 정렬을 통해 더 나은 맥락 통합을 수행한다.
- 번역 및 음성 합성 구성 요소의 공동 최적화를 위한 시퀀스-투-시퀀스 프레임워크를 사용한다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 음성-음성 번역 모델이 기존 모델에 비해 뛰어난 번역 품질과 음성 자연스러움을 달성할 수 있는가?
- RQ2모델이 말장난과 긴 정지와 같은 과도한 생성 아티팩트를 얼마나 효과적으로 완화할 수 있는가?
- RQ3모델이 번역된 음성에서 원본 화자 음성을 신뢰성 있게 유지할 수 있는가, 이를 통해 오용을 방지할 수 있는가?
- RQ4화자 음성 유지 기능이 실제 생산 환경에서의 강건성에 얼마나 기여하는가?
- RQ5데이터 증강이 다중 화자 시나리오에서 화자 전환을 처리하는 데 모델 능력을 어떻게 향상시키는가?
주요 결과
- Translatotron 2는 원본 Translatotron에 비해 번역 품질과 음성 자연스러움에서 뚜렷한 향상을 보였다.
- 모델은 말장난과 긴 정지와 같은 과도한 생성 아티팩트를 극적으로 감소시켰다.
- 화자 음성 유지 기능이 성공적으로 구현되어 모델이 다른 화자 음성으로 음성을 생성하는 것을 방지했다.
- 음성 유지 기능과 데이터 증강의 조합으로 입력 음성에서의 화자 전환 처리가 효과적으로 가능해졌다.
- 제약된 음성 합성으로 인해 위조 위험을 최소화함으로써 생산 환경에의 구현을 위한 강건성이 향상되었다.
- 제안된 데이터 증강 및 음성 유지 방법 덕분에 다수의 화자 음성이 포함된 음성 번역에서도 높은 성능을 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.