Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Audio Synthesis and Audio-Visual Multimodal Processing

Zhaofeng Shi|arXiv (Cornell University)|2021. 08. 01.
Music and Audio Processing참고 문헌 105인용 수 5
한 줄 요약

이 종합 검토는 딥러닝 기반 음성 합성 및 음성-시각 다중모달 처리에 대한 포괄적인 개요를 제공하며, 텍스트-to-음성(TTS), 음악 생성, 그리고 입술 읽기 및 음성-시각 음성 분離와 같은 다중모달 작업을 포함한다. FastSpeech2, VITS, MelGAN, Jukebox, VisualSpeech와 같은 최첨단 모델을 분류하여 그 아키텍처, 훈련 전략, 주요 벤치마크에서의 성능을 시연함으로써, 음성 생성 및 다중모달 학습 분야의 향후 연구를 위한 체계적인 참고 자료를 연구자들에게 제공한다.

ABSTRACT

With the development of deep learning and artificial intelligence, audio synthesis has a pivotal role in the area of machine learning and shows strong applicability in the industry. Meanwhile, significant efforts have been dedicated by researchers to handle multimodal tasks at present such as audio-visual multimodal processing. In this paper, we conduct a survey on audio synthesis and audio-visual multimodal processing, which helps understand current research and future trends. This review focuses on text to speech(TTS), music generation and some tasks that combine visual and acoustic information. The corresponding technical methods are comprehensively classified and introduced, and their future development trends are prospected. This survey can provide some guidance for researchers who are interested in the areas like audio synthesis and audio-visual multimodal processing.

연구 동기 및 목표

  • 최근 딥러닝 기반 음성 합성 분야의 발전, 즉 텍스트-to-음성(TTS) 및 음악 생성에 대한 체계적인 검토를 제공하기 위해.
  • 입술 읽기, 음성 분리, 대화형 얼굴 생성과 같은 음성-시각 다중모달 처리의 기술적 접근 방식을 분석하고 분류하기 위해.
  • 벤치마크 및 재현 가능성을 위해 TTS, 음악 생성, 음성-시각 작업에서 널리 사용되는 데이터셋을 요약하기 위해.
  • 음성 합성 및 다중모달 학습 분야의 주요 추세와 향후 연구 방향을 규명하기 위해.
  • 음성 생성 및 음성-시각 AI 분야에 진입하는 연구자들을 위한 참고 가이드로 기능하기 위해.

제안 방법

  • 두 단계(음성 모델 + 보코더)와 일체형 프레임워크로 나누어 TTS 방법을 분류하고, FastSpeech2, VITS, WaveGAN 변종과 같은 모델에 대한 세부 분석을 수행한다.
  • 기호 기반(MidiNet, MuseGAN 등)과 원시 음성(Jukebox, C-RNN-GAN 등) 생성 모델로 나누어 음악 생성을 분류하며, 아키텍처와 훈련 목표에 중점을 둔다.
  • 음성-시각 다중모달 모델에 대한 검토를 수행하며, 입술 읽기용 Vid2Speech, 노래 음성 분리용 Acapella, 시각적 신호를 이용한 음성 향상 및 분리용 VisualSpeech를 포함한다.
  • 주의 메커니즘, 플로우 기반 정규화(VITS 등에서 사용됨), 생성 모델에서의 적대적 훈련과 같은 핵심 기술적 구성 요소에 대한 체계적 검토를 수행한다.
  • MOS(평균 평가 점수), F0 정확도, 다중모달 작업에서의 WER(단어 오류율)와 같은 지표를 사용하여 모델 성능을 평가한다.
  • 모델 훈련 및 평가를 위한 벤치마크 데이터셋을 편집하고 비교하며, LJ Speech, LibriTTS, VCTK, MAESTRO, GRID, LRW, VoxCeleb을 포함한다.

실험 결과

연구 질문

  • RQ1현대적인 텍스트-to-음성 시스템에서 지배적인 아키텍처와 훈련 전략은 무엇이며, 두 단계형과 일체형 접근 방식 간의 주요 차이는 무엇인가?
  • RQ2기호 기반과 원시 음성 음악 생성 모델은 표현력, 훈련 복잡도, 출력 품질 측면에서 어떻게 비교될 수 있는가?
  • RQ3입술 시각 모odal이 입술 읽기 및 음성 분리와 같은 음성-시각 음성 처리 작업에서 성능 향상에 기여하는 역할은 무엇인가?
  • RQ4적대적 훈련, 정규화 플로우, 주의 메커니즘과 같은 딥러닝 기법 중에서 고음질 음성 및 다중모달 출력 생성에 가장 효과적인 것은 무엇인가?
  • RQ5공개된 데이터셋 중에서 음성 및 음성-시각 모델 훈련 및 평가에 가장 대표적이고 널리 사용되는 것은 무엇인가?

주요 결과

  • VITS 및 FastSpeech2와 같은 일체형 TTS 모델은 MOS 점수 4.0 이상을 기록하여 전통적인 두 단계형 시스템보다 품질과 훈련 효율성 측면에서 뛰어난 성능을 보인다.
  • MelGAN 및 Parallel WaveGAN과 같은 보코더는 인간의 녹음 수준에 근접한 청각적 품질을 가진 고해상도 웨이브폼을 생성하며, 실시간 추론을 가능하게 한다.
  • VisualSpeech와 같은 음성-시각 모델은 음성 분리 및 향상 분야에서 최첨단 성능을 달성하여, 시각적 입술 움직임을 활용해 소음 환경에서 단어 오류율을 최대 30%까지 감소시킨다.
  • Vid2Speech와 같은 입술 읽기 모델은 GRID 데이터셋에서 WER가 15% 이하를 기록하며, 시각적 신호를 활용한 고립된 단어 인식에서 뛰어난 성능을 보여준다.
  • MAESTRO 및 Lakh MIDI 데이터셋은 높은 정확도의 음악 생성을 가능하게 하며, Jukebox와 같은 모델은 구조적이고 타이밍이 일관된 다이내믹한 다이얼러지 악기 조합의 복잡한 곡을 생성할 수 있다.
  • LibriTTS(585시간) 및 VoxCeleb(10만 건 이상의 발화)와 같은 데이터셋은 다수의 화자 훈련을 가능하게 하여 다양성과 일반화 능력이 뛰어난 음성 합성 모델 개발을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.