[논문 리뷰] Image to Image Translation based on Convolutional Neural Network Approach for Speech Declipping
이 논문은 클리핑된 음성의 크기 스펙트로그램을 이미지로 간주하고, 이미지 간 번역 기법을 사용하여 이를 청소된 음성 스펙트로그램으로 변환함으로써 음성 클리핑 복원을 위한 U-Net 기반의 합성곱 신경망을 제안한다. 이 방법은 특히 심한 클리핑 및 소음 환경에서 기존 방법들을 능가하는 음성 품질과 이해 가능성 성능을 달성한다.
Clipping, as a current nonlinear distortion, often occurs due to the limited dynamic range of audio recorders. It degrades the speech quality and intelligibility and adversely affects the performances of speech and speaker recognitions. In this paper, we focus on enhancement of clipped speech by using a fully convolutional neural network as U-Net. Motivated by the idea of image-to-image translation, we propose a declipping approach, namely U-Net declipper in which the magnitude spectrum images of clipped signals are translated to the corresponding images of clean ones. The experimental results show that the proposed approach outperforms other declipping methods in terms of both quality and intelligibility measures, especially in severe clipping cases. Moreover, the superior performance of the U-Net declipper over the well-known declipping methods is verified in additive Gaussian noise conditions.
연구 동기 및 목표
- 오디오 레코더의 제한된 다이내믹 레인지로 인한 음성 품질 및 이해 가능성 저하 문제를 해결하기 위해.
- 클리핑된 음성 신호를 효과적으로 복원할 수 있는 딥 러닝 기반의 방법을 개발하기 위해.
- 컴퓨터 비전 분야에서 성공을 거둔 이미지 간 번역 기법을 음성 향상 작업에 활용하기 위해.
- 청결한 환경뿐 아니라 소음 환경에서도 성능을 향상시키며, 특히 심한 클리핑 조건에서의 성능 향상을 위해.
제안 방법
- 클리핑된 음성 스펙트로그램에서 청소된 음성 스펙트로그램으로의 엔드 투 엔드 매핑을 학습하기 위해 완전히 합성곱된 U-Net 아키텍처를 사용한다.
- 클리핑된 음성의 크기 스펙트로그램을 입력 이미지로 간주하고, 재구성된 청소된 스펙트로그램을 출력 이미지로 간주한다.
- 구조적 세부 정보를 유지하고 재구성 오차를 최소화하기 위해 adversarial loss와 L1 loss의 조합을 사용해 네트워크를 훈련시킨다.
- 백프로파게이션을 통해 Adam 옵timizer와 학습률 스케줄을 사용해 모델을 최적화한다.
- 실제 세계의 클리핑된 음성 데이터를 다양한 클리핑 심도로 훈련 및 평가한다.
- 추가적인 가우시안 노이즈 조건에서도 강건함을 입증하여, 노이즈가 있는 테스트 조건에서의 성능을 검증한다.
실험 결과
연구 질문
- RQ1U-Net 아키텍처를 사용한 이미지 간 번역 기법이 클리핑된 음성 신호를 효과적으로 복원할 수 있는가?
- RQ2제안된 클리핑 복원 방법은 음성 품질과 이해 가능성 측면에서 기존 방법들과 비교해 어떻게 성능을 내는가?
- RQ3추가 노이즈가 존재하는 상황에서나 심한 클리핑 조건에서도 성능을 유지할 수 있는가?
- RQ4모델은 다양한 클리핑 수준과 음성 콘텐츠에 대해 일반화 가능한가?
주요 결과
- U-Net 클리퍼는 PESQ, STOI 등의 객관적 품질 지표와 이해 가능성 측정치에서 기존의 클리핑 복원 방법들을 능가한다.
- 기존 방법이 실패하는 심한 클리핑 케이스에서도 상당한 성능 향상을 보였다.
- 가우시안 노이즈 조건에서는 기준 방법들보다 U-Net 클리퍼가 뛰어난 성능을 유지한다.
- adversarial loss와 L1 loss의 조합은 더 높은 청각적 품질과 더 나은 스펙트럼 재구성 성능을 이끌어냈다.
- 다양한 음성 신호와 클리핑 수준에 걸쳐 잘 일반화되어 있어 강건함을 입증했다.
- 논문 발표 당시 최고 성능을 기록했으며, ETECH 2019 컫런스에서 검증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.