Skip to main content
QUICK REVIEW

[논문 리뷰] Large-scale multilingual audio visual dubbing

Yi Yang, Brendan Shillingford|arXiv (Cornell University)|2020. 11. 06.
Music and Audio Processing참고 문헌 38인용 수 12
한 줄 요약

이 논문은 번역된 음성과 동기화된 입술 움직임을 합성함으로써 영상 콘텐츠를 목표 언어로 대규모로 번역하는 다국어 음성영상 더빙 시스템을 제시한다. 특정 화자에 맞게 미세조정된 다국어, 다화자 입술 동기화 모델을 사용하여 높은 자연스러움과 음성영상 동기화를 달성함으로써 언어 장벽을 넘어 교육 콘텐츠의 참여도와 접근성을 크게 향상시킨다.

ABSTRACT

We describe a system for large-scale audiovisual translation and dubbing, which translates videos from one language to another. The source language's speech content is transcribed to text, translated, and automatically synthesized into target language speech using the original speaker's voice. The visual content is translated by synthesizing lip movements for the speaker to match the translated audio, creating a seamless audiovisual experience in the target language. The audio and visual translation subsystems each contain a large-scale generic synthesis model trained on thousands of hours of data in the corresponding domain. These generic models are fine-tuned to a specific speaker before translation, either using an auxiliary corpus of data from the target speaker, or using the video to be translated itself as the input to the fine-tuning process. This report gives an architectural overview of the full system, as well as an in-depth discussion of the video dubbing component. The role of the audio and text components in relation to the full system is outlined, but their design is not discussed in detail. Translated and dubbed demo videos generated using our system can be viewed at https://www.youtube.com/playlist?list=PLSi232j2ZA6_1Exhof5vndzyfbxAhhEs5

연구 동기 및 목표

  • 온라인 교육에서의 언어 장벽을 해결하기 위해 교육 영상을 다국어로 대규모로 번역할 수 있도록 하는 것.
  • 자막 대신 자연스러운 입술 움직임을 유지하는 음성영상 더빙을 통해 시청자 참여도를 향상시키는 것.
  • 번역된 음성과 현실적이고 화자별로 특화된 입술 움직임을 원활하게 동기화하는 시스템을 개발하는 것.
  • 최소한의 화자별 데이터로 미세조정하여 스케일링이 가능하고 자동화된 더빙을 구현하는 것.
  • 다양한 언어에서 높은 청각적 품질로 교육 콘텐츠에 접근 가능하게 하여 접근성을 확대하는 것.

제안 방법

  • 20개 언어에서 총 3,700시간에 이르는 대규모 다국어 화자별 시각적 음성 데이터셋을 수집하여 다화자 입술 동기화 모델을 사전 훈련하는 데 사용한다.
  • 입술 동기화 모델은 영상 프레임, 기준 프레임, 음성 임베딩을 위한 세 개의 독립적 인코더와 입술 영역 프레임을 생성하기 위한 디코더를 갖춘 잔차 U-Net 아키텍처이다.
  • 화자별로 특화된 미세조정은 소량의 보조 화자 데이터 또는 대상 영상 자체를 입력으로 사용하여 수행된다.
  • 음성 번역은 수천 시간에 이르는 데이터로 훈련된 화자 적응형 텍스트-음성 합성(TTS) 모델을 사용하며, 각 화자별로 미세조정된다.
  • 번역된 음성의 지속시간을 원본 영상과 일치시키기 위해 속도 조절을 수행한 후, 입술 동기화 모델을 적용하여 동기화된 얼굴 프레임을 생성한다.
  • 최종 영상 출력은 이미지 처리 기법을 사용해 예측된 입술 프레임을 원본 영상과 융합하여 신원과 조명 일관성을 유지한다.

실험 결과

연구 질문

  • RQ1한 개의 대규모 입술 동기화 모델이 다양한 언어와 화자에 대해 일반화되면서도 번역된 음성과 높은 동기화 수준을 유지할 수 있는가?
  • RQ2소량의 데이터(예: 몇 분 분량의 영상)로도 화자별로 특화된 미세조정이 입술 움직임의 현실감과 동기화 수준을 향상시키는 데 얼마나 효과적인가?
  • RQ3사전 훈련된 다국어 모델과 화자별 적응을 조합했을 때 청각적 자연스러움과 음성영상 정렬에 어떤 영향을 미치는가?
  • RQ4비모국어 사용자에게 있어 시청자 참여도, 공간적 몰입감, 이해도 측면에서 자막 대비 시스템의 성능은 어떠한가?
  • RQ5음성영상 번역 과정에서 원본 화자의 신원과 시각적 특징을 얼마나 잘 유지할 수 있는가?

주요 결과

  • 사전 훈련된 가중치와 화자별 데이터를 모두 사용해 미세조정한 모델이 자연스러움(MOS: 3.04 ± 0.07)과 동기화 수준(MOS: 2.12 ± 0.05)에서 가장 높은 평점을 기록했다.
  • 미세조정만으로는 영상 품질은 향상되었지만 음성영상 동기화 수준이 악화되어 사전 훈련이 기초가 되어야 함을 시사했다.
  • 사전 훈련만 수행한 모델는 자연스러움(2.35 ± 0.07)과 동기화 수준(1.93 ± 0.04)에서 낮은 점수를 기록하여 화자 적응의 유용성을 입증했다.
  • 다양한 언어에서 뛰어난 성능을 보였으며, 다국어 모델은 다국어 테스트 세트에서 동기화에 대해 MOS 78.5를 기록했다.
  • 주관적 평가 결과, 사전 훈련과 미세조정을 병행한 조합이 자연스러움과 입술 동기화 정확도에서 각각의 방법만을 사용하는 것보다 유의미하게 뛰어난 성능을 보였다.
  • 시스템은 물리적 워터마크가 부착된 합성 영상과 동의를 얻은 콘텐츠를 성공적으로 생성하여 오용 위험을 최소화하면서 교육 접근성을 높였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.