Skip to main content
QUICK REVIEW

[논문 리뷰] Sandglasset: A Light Multi-Granularity Self-attentive Network For Time-Domain Speech Separation

Max W. Y. Lam, Jun Wang|arXiv (Cornell University)|2021. 03. 01.
Speech and Audio Processing참고 문헌 18인용 수 4
한 줄 요약

Sandglasset은 시간 도메인 음성 분리에 적합한 경량이며 다중 시간 해상도(self-attentive) 네트워크를 제안한다. 모델은 계단 모양의 아키텍처를 사용하여 계층적으로 시간 해상도를 점차로 흐리게 하고 다시 정제하는 방식으로 작동한다. 오직 230만 개의 파라미터만을 사용하여 WSJ0-2mix에서 20.8 dB, WSJ0-3mix에서 17.1 dB의 최신 기준 SI-SNRi 점수를 기록했으며, 이는 이전 최고 성능 모델 대비 각각 0.8 dB, 2.4 dB 향상된 성능이다. 또한 가장 작은 이전 모델 대비 연산량(FLOPs)을 66% 감소시키고 메모리 사용량을 58.4% 줄였다.

ABSTRACT

One of the leading single-channel speech separation (SS) models is based on a TasNet with a dual-path segmentation technique, where the size of each segment remains unchanged throughout all layers. In contrast, our key finding is that multi-granularity features are essential for enhancing contextual modeling and computational efficiency. We introduce a self-attentive network with a novel sandglass-shape, namely Sandglasset, which advances the state-of-the-art (SOTA) SS performance at significantly smaller model size and computational cost. Forward along each block inside Sandglasset, the temporal granularity of the features gradually becomes coarser until reaching half of the network blocks, and then successively turns finer towards the raw signal level. We also unfold that residual connections between features with the same granularity are critical for preserving information after passing through the bottleneck layer. Experiments show our Sandglasset with only 2.3M parameters has achieved the best results on two benchmark SS datasets -- WSJ0-2mix and WSJ0-3mix, where the SI-SNRi scores have been improved by absolute 0.8 dB and 2.4 dB, respectively, comparing to the prior SOTA results.

연구 동기 및 목표

  • 단일 채널 음성 분리에서 고정된 세그먼트 크기 모델의 한계를 해결하기 위해 다중 시간 해상도에 걸쳐 계층적 모델링을 가능하게 하기 위해.
  • 새로운 self-attentive 아키텍처를 통해 다이나믹한 시간 해상도를 적용하여 시간 도메인 음성 분리에서 문맥 모델링과 계산 효율성을 향상시키기 위해.
  • 기존 최고 성능 모델 대비 모델 크기와 계산 비용을 줄이면서도 분리 성능을 유지하거나 향상시키기 위해.
  • 계층적 네트워크의 버티컬 레이어를 통과할 때 동일한 해상도 수준 간 잔차 연결(residual connections)이 정보 보존에 미치는 영향을 조사하기 위해.

제안 방법

  • 모델은 N/2개의 블록을 사용해 굵은 해상도에서 세밀한 해상도로 처리하는 인코더와, 세밀한 해상도에서 굵은 해상도로 재구성하는 디코더로 구성된 계단 모양 아키텍처를 사용하여 다중 시간 해상도 특징 모델링을 가능하게 한다.
  • 각 블록은 특정 시간 해상도에서 장거리 의존성을 모델링하기 위해 self-attention 메커니즘을 적용하며, 세그먼트 크기가 각 블록 간에 달라져서 음소, 음절, 어휘 수준의 특징을 포괄한다.
  • 인코더와 디코더 경로에서 동일한 해상도 수준의 특징 간에 잔차 연결을 적용하여 정보 보존과 기울기 소실 문제 완화를 도모한다.
  • 모델은 이중 경로 세그먼트 전략을 적용하여 국소적 및 전역적 시퀀스를 RNN 대신 self-attention으로 처리함으로써 전역적 문맥 모델링을 향상시킨다.
  • 일관된 말하기 주장을 동적으로 혼합하는 후학습 전략을 적용하여 일반화 능력과 수렴 성능을 향상시킨다.
  • 모델는 종단 간 음성 분리 목적으로 시간 도메인 손실을 사용한 문장 수준의 순열 불변 트레이닝(u-PIT) 방식으로 훈련된다.

실험 결과

연구 질문

  • RQ1고정된 세그먼트 크기 접근 방식에 비해 다중 시간 해상도 특징 모델링이 시간 도메인 음성 분리에서 문맥 표현을 향상시키는가?
  • RQ2이중 경로 세그먼트 프레임워크에서 전역 시퀀스의 장거리 의존성을 모델링할 때 self-attention 메커니즘이 RNN을 능가하는가?
  • RQ3계층적 네트워크의 버티컬 레이어를 통과할 때 동일한 해상도 수준 간의 잔차 연결은 정보 보존에 어떤 영향을 미치는가?
  • RQ4경량 아키텍처가 모델 크기와 계산 비용을 크게 줄이면서도 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • Sandglasset은 WSJ0-2mix 데이터셋에서 기존 최고 성능을 0.8 dB 향상시킨 20.8 dB의 새로운 최고 기록 SI-SNRi 점수를 기록했다.
  • WSJ0-3mix 데이터셋에서는 17.1 dB의 SI-SNRi 점수를 기록하여 기존 최고 성능을 2.4 dB 향상시켰다.
  • 모델는 오직 230만 개의 파라미터만을 사용하여 지금까지 보고된 단일 채널 음성 분리 모델 중 가장 가벼운 모델이다.
  • DPRNN과 같은 가장 작은 이전 모델 대비 FLOPs를 66.0% 감소시키고 메모리 사용량을 58.4% 줄였음에도 불구하고, 성능는 이를 뛰어넘었다.
  • 제거 실험(ablation studies) 결과, 다중 해상도 모델링이나 잔차 연결을 제거할 경우 성능 저하가 심각하게 발생하여 이들의 중요성을 입증했다.
  • 후학습 단계에서의 데이터 증강 전략이 성능 향상에 기여함을 확인하여, 모델 일반화 능력 향상에 효과적이라는 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.