[논문 리뷰] Speech Denoising by Accumulating Per-Frequency Modeling Fluctuations
이 논문은 단일 노이즈 있는 오디오 클립을 대상으로 WaveUnet 내에서 주파수별 모델링 변동성을 활용하여 노이즈를 식별하고 억제하는 비지도 학습 기반 음성 노이즈 제거 방법을 제안한다. 단일 노이즈 있는 오디오 클립을 학습시키고 시간-주파수 영역에서의 피팅 스코어를 누적시킴으로써, 이 방법은 청소된 음성을 복원하기 위해 고전적 필터를 적용하며, 지도 학습 기반 최신 기술과 유사한 성능을 달성하고 비정적 노이즈 환경에서 비지도 기반 기존 기술들보다 뛰어난 성능을 보인다.
We present a method for audio denoising that combines processing done in both the time domain and the time-frequency domain. Given a noisy audio clip, the method trains a deep neural network to fit this signal. Since the fitting is only partly successful and is able to better capture the underlying clean signal than the noise, the output of the network helps to disentangle the clean audio from the rest of the signal. This is done by accumulating a fitting score per time-frequency bin and applying the time-frequency domain filtering based on the obtained scores. The method is completely unsupervised and only trains on the specific audio clip that is being denoised. Our experiments demonstrate favorable performance in comparison to the literature methods. Our code and samples are available at github.com/mosheman5/DNP and as supplementary. Index Terms: Audio denoising; Unsupervised learning
연구 동기 및 목표
- 지도 학습 기반 기술의 발전에도 불구하고 비지도 딥러닝 기반 음성 노이즈 제거 분야에서의 진전 부족 문제를 해결하기 위해.
- 무음 세그먼트나 노이즈 정적성 등의 히우리스틱 가정에 의존하는 전통적 비지도 방법의 한계를 극복하기 위해.
- 청소된 기준 신호나 외부 데이터셋이 필요 없이 단일 노이즈 있는 오디오 클립에서만 작동하는 방법을 개발하기 위해.
- 신경망 피팅의 불안정성을 활용하여 노이즈 성분을 식별하고 주파수별 스코어 누적으로 성능을 향상시키기 위해.
제안 방법
- 랜덤 잠재 벡터를 입력으로 사용하여 단일 노이즈 있는 오디오 클립을 학습시키며, 재구성 오차 $\|f_\theta(z) - y\|$ 를 최소화하는 WaveUnet을 훈련한다.
- 학습 반복 동안 네트워크의 피팅 진행 상황을 모니터링하여, 모델이 가장 어려움을 겪는 시간-주파수 영역을 식별함으로써 노이즈 성분을 파악한다.
- 학습 중 모델링 변동의 크기에 따라 각 시간-주파수 영역에 대한 피팅 스코어를 누적한다.
- 누적된 피팅 스코어를 마스크로 사용하여 고전적 시간-주파수 도메인 필터(예: 위너 필터 또는 LSA)를 적용하여 노이즈 성분을 억제한다.
- 평가 시 청소된 신호와 비교하여 최상의 네트워크 출력을 선택함으로써 최종 노이즈 제거 신호를 결정한다.
- 저주파수 노이즈를 제거하기 위해 후처리로 고역통과 필터(60 Hz 커프오프)를 적용한다.
실험 결과
연구 질문
- RQ1단일 노이즈 있는 오디오 클립을 학습하는 딥러닝 네트워크에서 주파수별 모델링 변동성을 효과적으로 청소된 음성과 노이즈를 구분하는 데 사용할 수 있는가?
- RQ2학습 불안정성에 기반한 비지도 방법이 노이즈 정적성이나 무음 세그먼트 등의 가정에 의존하는 전통적 비지도 노이즈 제거 알고리즘보다 성능이 뛰어나게 되는가?
- RQ3이러한 방법이 청소된 학습 데이터에 접근할 수 없음에도 불구하고 지도 학습 기반 최신 기술과 유사한 성능을 달성할 수 있는가?
- RQ4기존 비지도 방법이 실패하는 비정적 노이즈 환경에서 제안된 방법의 성능은 어떠한가?
주요 결과
- 제안된 방법은 CSIG, CBAK, COVL, PESQ, SSNR 모든 지표에서 대부분의 비지도 기반 기준 기술보다 뛰어나며, CSIG 및 SSNR에서 MMSE-LSA를 제외하고는 두 번째로 높은 성능을 기록한다.
- 무음 세그먼트가 없는 상황(예: 침묵 부분을 잘라낸 후)에서는 MMSE-LSA보다 크게 뛰어나며, 히우리스틱 가정에 대한 민감도가 낮음을 보여준다.
- 청소된 학습 데이터 없이도 단일 노이즈 클립에서만 학습된 비지도 방법임에도 불구하고 지도 학습 기반 SEGAN 모델과 유사한 성능을 달성한다.
- DAP [18]에 비해 크게 뛰어나며, 특히 DAP의 조화 분해 컨볼루션으로 인해 중간-고주파수 SNR 조건에서 가우시안 유사 잡음 아티팩트가 발생하기 때문이다.
- 학습 중에 다수의 네트워크 출력을 평균화해도 성능 향상이 없으며, 이미지 DIP와는 달리 음성 신호와 이미지 신호의 본질적 차이를 반영한다.
- 이 방법은 신호의 구조적 가정(예: 클립 끝부분의 침묵 또는 무음 내용)에 의존하지 않아 안정적이고 일반화 능력이 뛰어나다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.