Skip to main content
QUICK REVIEW

[논문 리뷰] Phase reconstruction based on recurrent phase unwrapping with deep neural networks

Yoshiki Masuyama, Kohei Yatabe|arXiv (Cornell University)|2020. 02. 14.
Speech and Audio Processing참고 문헌 30인용 수 5
한 줄 요약

이 논문은 직접적인 위상 추정의 불안정성을 피하기 위해 위상 도함수(순간 주파수 및 군속도 지연)를 예측하는 두 단계의 딥 네ural 네트워크(DNN) 기반 위상 복원 방법을 제안한다. 이 도함수들은 새로운 순환 위상 풀이(RPU) 기법을 통해 반복적으로 풀어낸다. 제안된 방법은 바르막스 DNN를 사용한 직접 위상 추정 및 순간 주파수의 수치적 통합 방식보다 목적적 지표와 청취 품질 측면에서 모두 뛰어나다.

ABSTRACT

Phase reconstruction, which estimates phase from a given amplitude spectrogram, is an active research field in acoustical signal processing with many applications including audio synthesis. To take advantage of rich knowledge from data, several studies presented deep neural network (DNN)--based phase reconstruction methods. However, the training of a DNN for phase reconstruction is not an easy task because phase is sensitive to the shift of a waveform. To overcome this problem, we propose a DNN-based two-stage phase reconstruction method. In the proposed method, DNNs estimate phase derivatives instead of phase itself, which allows us to avoid the sensitivity problem. Then, phase is recursively estimated based on the estimated derivatives, which is named recurrent phase unwrapping (RPU). The experimental results confirm that the proposed method outperformed the direct phase estimation by a DNN.

연구 동기 및 목표

  • 파형 이동에 민감한 위상에 의한 직접 DNN 기반 위상 복원의 불안정성 문제를 해결하기 위해.
  • 원시 위상 대신 위상 도함수를 활용하여 위상 추정에서 발생하는 감싸임 현상을 극복하기 위해.
  • 도함수 추정 후 순차적 풀이를 통해 이루어지는 두 단계 접근 방식을 통해 위상 복원 정확도를 향상시키기 위해.
  • 과적합 경향이 있는 표준 DNN에 비해 일반화 능력이 뛰어난 안정적이고 미분 가능한 위상 복원 프레임워크를 개발하기 위해.
  • 제안된 방법이 직접 위상 추정 및 전통적인 위상 복원 기준보다 뛰어나다는 것을 검증하기 위해.

제안 방법

  • 로그 진폭 스펙트로그램에서 순간 주파수(IF) 및 군속도 지연(GD)를 추정하기 위해 두 개의 별도 DNN를 사용한다.
  • 완전 연결 DNN를 사용하여 위상 도함수를 예측하며, 게이트드 탄젠트 활성화 함수를 사용하고 입력 특징를 정규화한다(현재 프레임 및 ±2 프레임의 로그 진폭).
  • 제안된 순환 위상 풀이(RPU) 알고리즘은 시간-주파수 빈에 대해 최소 제곱 최적화 문제를 해결함으로써 반복적으로 위상 풀이를 수행한다.
  • RPU는 위상 복원을 2차원 위상 풀이 문제로 간주하며, 추정된 위상 도함수와 진짜 위상 도함수 간의 차이를 최소화하면서 연속성을 강제한다.
  • 직접 위상 회귀를 피함으로써, 표준 DNN가 불안정하게 만들 수 있는 미세한 시간 도메인 이동에 대한 민감도를 감소시킨다.
  • 평가 시 위상 복원 품질을 향상시키기 위해 그리피스-림 알고리즘(GLA)을 후처리로 적용한다.

실험 결과

연구 질문

  • RQ1원시 위상 대신 위상 도함수를 예측하는 것이 DNN 기반 위상 복원의 안정성과 정확도를 향상시키는가?
  • RQ2도함수 추정 후 순차적 풀이를 거치는 두 단계 접근 방식이 직접 위상 추정보다 더 나은 위상 복원 성능을 내는가?
  • RQ3제안된 RPU 방법은 바르막스 DNN를 사용한 직접 위상 추정 및 순간 주파수의 수치적 통합 기반 기준 방식과 비교해 어떻게 성능을 내는가?
  • RQ4특히 직접 위상 DNN의 과적합 경향을 감안할 때, 제안된 방법이 새로운 테스트 데이터로 일반화되는 정도는 어느 정도인가?
  • RQ5순간 주파수와 군속도 지연을 동시에 추정하는 것이 IF만을 사용하는 경우보다 더 정확한 위상 복원을 가능하게 하는가?

주요 결과

  • 위상 도함수를 위한 DNN(IFS 및 GD)는 각각 테스트 정확도 0.644와 0.646을 달성하였으며, 직접 위상 추정 정확도 0.003보다 유의미하게 높았다.
  • 직접 위상 추정 DNN는 심각한 과적합을 보였으며, 훈련 정확도 0.238이지만 테스트 정확도는 오직 0.003에 그쳐 일반화 능력이 떨어짐을 시사했다.
  • 제안된 RPU 방법은 직접 위상 추정(STOI: 0.72, PESQ: 1.74) 및 IF 전용 복원(STOI: 0.75, PESQ: 1.85)보다 높은 STOI(0.77) 및 PESQ(1.98) 점수를 기록했다.
  • 직접 위상 DNN를 테스트 세트로 재학습한 경우(Ph test)조차도 제안된 방법에 비해 STOI 및 PESQ에서 열등했으며, RPU의 강건성을 확인했다.
  • 일측 t-검정 결과, STOI 및 PESQ 지표 모두에서 제안된 방법에 유의미한 우월성이 있었으며(p < 0.01).
  • 오디오 샘플 분석 결과, 제안된 방법은 기준 대비 더 자연스럽고 잡음이 적은 음성을 생성함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.