Skip to main content
QUICK REVIEW

[논문 리뷰] VoiceFixer: A Unified Framework for High-Fidelity Speech Restoration

Haohe Liu, Xubo Liu|arXiv (Cornell University)|2022. 04. 12.
Speech and Audio Processing참고 문헌 32인용 수 6
한 줄 요약

VoiceFixer는 멜 스펙트로그램 분석과 신경 보컬라이저 기반 파형 합성으로, 소음, 리버버버션, 클리핑, 저대역폭 품질 악화 등 여러 종류의 왜곡을 동시에 처리하는 통합 딥러닝 프레임워크입니다. 이중 단계 아키텍처(멜 스펙트로그램 추정 → 신경 보컬라이저 기반 파형 합성)를 사용하여 기준 방법보다 MOS 점수를 0.256 높게 기록하고, 청각적 품질에서 거의 오라클 성능에 도달하며, 심지어 심각하게 손상된 역사적 녹음자료까지 복원할 수 있습니다.

ABSTRACT

Speech restoration aims to remove distortions in speech signals. Prior methods mainly focus on a single type of distortion, such as speech denoising or dereverberation. However, speech signals can be degraded by several different distortions simultaneously in the real world. It is thus important to extend speech restoration models to deal with multiple distortions. In this paper, we introduce VoiceFixer, a unified framework for high-fidelity speech restoration. VoiceFixer restores speech from multiple distortions (e.g., noise, reverberation, and clipping) and can expand degraded speech (e.g., noisy speech) with a low bandwidth to 44.1 kHz full-bandwidth high-fidelity speech. We design VoiceFixer based on (1) an analysis stage that predicts intermediate-level features from the degraded speech, and (2) a synthesis stage that generates waveform using a neural vocoder. Both objective and subjective evaluations show that VoiceFixer is effective on severely degraded speech, such as real-world historical speech recordings. Samples of VoiceFixer are available at https://haoheliu.github.io/voicefixer.

연구 동기 및 목표

  • 기존 음성 복원 모델이 소음 제거나 리버버버션 제거와 같이 단일 왜곡 유형에만 집중하는 한계를 해결하기 위해.
  • 소음, 리버버버션, 클리핑, 저대역폭 등 다수의 동시 왜곡으로 인해 손상된 음성을 복원할 수 있는 통합 프레임워크를 개발하기 위해.
  • 역사적 녹음자료처럼 심각하게 손상된 입력에서도 고음질(44.1 kHz) 음성 복원을 실현하여, 저음질 또는 단일 왜곡 처리 방법을 뛰어넘는 청각적 품질 향상을 이루기 위해.
  • 연속된 모델을 통합형 엔드 투 엔드 학습 가능한 아키텍처로 대체함으로써 계산 비용을 줄이고 아티팩트 누적를 최소화하기 위해.
  • 향후 다중 왜곡 음성 복원 분야의 연구를 가속화하기 위해 사전 학습된 모델과 코드베이스를 공개하기 위해.

제안 방법

  • 프레임워크는 분석 단계와 합성 단계로 구성된 이중 단계 설계를 사용합니다. 분석 단계는 ResUNet 기반 네트워크를 통해 왜곡된 음성에서 멜 스펙트로그램을 추정하고, 합성 단계는 신경 보컬라이저(TFGAN)를 통해 고음질 파형을 생성합니다.
  • 중간 특징은 저차원 멜 스펙트로그램으로 표현되며, 이는 다양한 종류의 왜곡을 통합적으로 복원하는 데 공통된 표현으로 기능합니다.
  • 왜곡은 순차적 연산의 복합 함수로 모델링되며, 덧셈 소음, 실내 인파르스 응답(리버버버션)에 의한 컨볼루션, 고정된 범위 내에서의 진폭 클리핑이 포함됩니다.
  • 분석 모듈은 왜곡된 입력에서 정제된 멜 스펙트로그램을 예측하도록 학습되며, 합성 모듈은 대규모 음성 데이터셋으로 사전 학습되어 멜 특징에서 고품질 파형을 생성할 수 있도록 합니다.
  • 전체 시스템은 이중 단계 학습 방식으로 운영되며, 분석과 합성이 별도로 최적화되며, 더 나은 파형 생성을 위해 사전 학습된 보컬라이저 사전 지식을 활용합니다.
  • 프레임워크는 다중 왜곡 복원과 음성 슈퍼레졸루션 모두를 지원하여, 저대역폭 음성(1–22.05 kHz)을 44.1 kHz 전체 대역폭으로 확장할 수 있습니다.

실험 결과

연구 질문

  • RQ1소음, 리버버버션, 클리핑, 저대역폭 등 여러 종류의 동시 왜곡으로 손상된 음성을 효과적으로 복원할 수 있는 통합 딥러닝 프레임워크가 가능한가?
  • RQ2직접 파형이나 스펙트로그램을 모델링하는 것과 비교해, 중간 특징으로 멜 스펙트로그램을 사용할 경우 다중 왜곡 음성 복원의 강건성과 성능이 향상되는가?
  • RQ3심각하게 손상된 입력에서도 고음질(44.1 kHz) 음성 복원이 가능하며, 이를 통해 정제된 음성과 거의 동일한 청각적 품질을 달성할 수 있는가?
  • RQ4목표 측정치(PESQ, SSIM, LSD)와 주관적 MOS 측정치에서 VoiceFixer는 연속 모델이나 작업별 전용 기준 방법보다 성능이 뛰어나나?
  • RQ5사전 학습된 신경 보컬라이저가 통합 복원 파이프라인에서 추정된 멜 스펙트로그램에서 고음질 파형을 복원하는 데 얼마나 일반화될 수 있는가?

주요 결과

  • VoiceFixer는 HiFi-Res 테스트 세트에서 평균 의견 점수(MOS) 3.62를 기록하여 기준 UNet 방법보다 0.256 높고, 오라클-멜 기준과는 0.11 밖에 떨어지지 않습니다.
  • VD-Test 소음 제거 벤치마크에서 VoiceFixer는 PESQ-wb 점수 2.43을 기록하여 SEGAN, WaveUNet 및 약한 레이블링 모델(WL-Model)을 모두 앞서며, 목표 MOS 3.69와 일치합니다.
  • 클리핑 작업에서, VoiceFixer는 클리핑 수준 0.25와 0.10 모두에서 MOS 3.38을 기록하여 SSPADE보다 각각 0.04와 1.25점 높게 기록하며, 뛰어난 청각적 품질을 입증합니다.
  • PESQ-wb 및 SSIM 등의 목표 측정치에서는 낮은 점수를 기록했지만, 주관적 MOS에서 가장 큰 향상을 보였으며, 이는 청각적 품질 향상이 일반적인 목표 측정치로는 항상 반영되지 않는다는 것을 시사합니다.
  • 프레임워크는 저대역폭 음성(1–22.05 kHz)을 44.1 kHz 전체 대역폭으로 성공적으로 복원하여 고음질 출력을 생성하였으며, 고주파 성분 에너지가 향상되어 청취자 인식에 유리한 영향을 미쳤습니다.
  • 사전 학습된 모델과 코드베이스의 공개로 향후 다중 왜곡 음성 복원 분야의 연구를 가속화하고, 추가적인 왜곡 유형으로의 확장도 가능해졌습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.