Skip to main content
QUICK REVIEW

[논문 리뷰] ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement

Wei-Ning Hsu, Tal Remez|arXiv (Cornell University)|2022. 12. 21.
Speech and Audio Processing인용 수 4
한 줄 요약

ReVISE는 자기지도 학습된 음성 모델의 이산 단위와 시각 입력을 활용하여 소음, 반향, 분리, 인painting, 영상-음성 합성 등 다양한 왜곡을 통합하는 보편적이고 자기지도 학습 기반의 음성-영상 음향 향상 프레임워크를 제안한다. 이는 합성(LRS3) 및 실세계(EasyCom) 벤치마크에서 최신 기술을 초월하는 성능을 달성하며, 텍스트 지도 없이도 음성의 명료성과 품질을 크게 향상시킨다.

ABSTRACT

Prior works on improving speech quality with visual input typically study each type of auditory distortion separately (e.g., separation, inpainting, video-to-speech) and present tailored algorithms. This paper proposes to unify these subjects and study Generalized Speech Enhancement, where the goal is not to reconstruct the exact reference clean signal, but to focus on improving certain aspects of speech. In particular, this paper concerns intelligibility, quality, and video synchronization. We cast the problem as audio-visual speech resynthesis, which is composed of two steps: pseudo audio-visual speech recognition (P-AVSR) and pseudo text-to-speech synthesis (P-TTS). P-AVSR and P-TTS are connected by discrete units derived from a self-supervised speech model. Moreover, we utilize self-supervised audio-visual speech model to initialize P-AVSR. The proposed model is coined ReVISE. ReVISE is the first high-quality model for in-the-wild video-to-speech synthesis and achieves superior performance on all LRS3 audio-visual enhancement tasks with a single model. To demonstrates its applicability in the real world, ReVISE is also evaluated on EasyCom, an audio-visual benchmark collected under challenging acoustic conditions with only 1.6 hours of training data. Similarly, ReVISE greatly suppresses noise and improves quality. Project page: https://wnhsu.github.io/ReVISE.

연구 동기 및 목표

  • 소음 제거, 반향 제거, 분리, 인painting, 영상-음성 합성 등 다양한 음성 향상 작업을 하나의 일반화된 프레임워크로 통합하기 위해.
  • 왜곡 유형에 특화된 모델의 한계를 해결하기 위해, 다양한 종류의 음향 왜곡에 일반화 가능한 보편적인 향상 접근법을 제안하기 위해.
  • 청정 기준 신호의 정확한 재구성 없이도 음성의 명료성, 품질, 동기화를 향상시키기 위해.
  • 이전에 달성되지 못했던 고품질의 실세계 영상-음성 합성 작업을 가능하게 하기 위해.
  • EasyCom과 같이 자원이 적은 실세계 음성-영상 데이터셋에서의 데이터 효율성과 강건성을 입증하기 위해.

제안 방법

  • ReVISE는 음성-영상 음성 재구성 문제로 음성 향상을 설정하며, 이는 두 단계로 구성된다: 가짜 음성-영상 음성 인식(P-AVSR)과 가짜 텍스트-음성 합성(P-TTS).
  • P-AVSR는 시각적 입력과 노이즈가 섞인 음성 입력으로부터 이산 음성 단위를 예측하며, 자기지도 학습된 음성-영상 모델(AV-HuBERT)을 초기화에 사용한다.
  • P-TTS는 예측된 이산 단위에서 고해상도 음성을 생성하며, 텍스트 지도 없이 자기지도 학습된 음성 단위를 중간 표현으로 사용함으로써 텍스트 지도를 회피한다.
  • 자기지도 학습된 음성 모델(예: HuBERT)에서 유도된 이산 단위를 통해 P-AVSR와 P-TTS를 연결함으로써, 전사본 없이도 엔드 투 엔드 학습이 가능하다.
  • 모델은 전사본 없이도 다양한 손상된 데이터 유형(예: LRS3의 합성 왜곡 및 EasyCom의 실세계 데이터)에서 엔드 투 엔드로 훈련되며, 작업별 특화 미세조정이 필요하지 않다.
  • 제거 분석을 통해 시각 입력, 사전 훈련, 자기지도 학습 단위의 선택이 중요하며, 더 큰 모델과 더 나은 SSL 단위에서 성능 향상이 확인되었다.

실험 결과

연구 질문

  • RQ1한 개의 모델이 소음 제거, 분리, 인painting, 영상-음성 합성 등 다양한 종류의 음성 왜곡에 일반화될 수 있는가?
  • RQ2텍스트 대신 자기지도 학습된 음성 단위를 사용할 경우, 자원이 적거나 실세계 환경에서의 일반화와 성능 향상에 어떤 영향을 미치는가?
  • RQ3음성이 심하게 손상되거나 일부 프레임이 손실된 경우, 시각 입력이 음성의 명료성과 품질 향상에 얼마나 효과적인가?
  • RQ4예를 들어 소음 제거 작업에서 훈련된 모델이 해당 작업에 대해 훈련된 바 없이도 영상-음성 합성과 같은 새로운 왜곡 유형으로 제로샷 일반화가 가능한가?
  • RQ5자기지도 학습된 음성-영상 표현에서 사전 훈련을 수행할 경우, 후속 향상 작업 성능에 얼마나 기여하는가?

주요 결과

  • ReVISE는 단일 통합 모델로 LRS3의 네 가지 향상 작업(소음 제거, 분리, 인painting, 영상-음성 합성)에서 최신 기술을 초월하는 성능을 달성한다.
  • 훈련 데이터가 단 1.6시간인 과도한 EasyCom 벤치마크에서 ReVISE는 강력한 마스킹 기반 기준 모델 대비 최대 37.5%p의 단어 오류율(WER) 감소와 평균 평가 점수(MOS) 최대 1.09 향상을 기록한다.
  • ReVISE는 이전 모델보다 더 높은 품질의 음성을 생성한다: MOS 점수는 채널 2 기준 4.19, 빔포밍 기준 4.11에 도달하여 원본 원거리 녹음(2.95 및 2.67)을 크게 능가한다.
  • 모델은 해당 작업에 대한 훈련 없이도 영상-음성 합성으로의 제로샷 일반화를 달성하여 강력한 강건성과 보편성을 입증한다.
  • 제거 분석 결과, AV-HuBERT로 P-AVSR를 사전 훈련하면 기준 모델 대비 WER가 Base 모델 기준 38.9% 감소, Large 모델 기준 43.1% 감소하며, 시각 입력은 모든 작업에서 성능 향상을 이끌어내며 특히 분리 및 인painting 작업에서 두드러진다.
  • LibriSpeech(LS960)에서 훈련된 HuBERT 단위를 사용할 경우 V2S WER는 35.2로 감소하지만, LRS3+VoxCeleb2에서 훈련된 AV-HuBERT 단위를 사용할 경우 41.2로 나타나 사전 훈련 데이터 분포가 성능에 영향을 미친다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.