Skip to main content
QUICK REVIEW

[논문 리뷰] An efficient encoder-decoder architecture with top-down attention for speech separation

Kai Li, Runxuan Yang|arXiv (Cornell University)|2022. 09. 30.
Speech and Audio Processing인용 수 15
한 줄 요약

이 논문은 상향식 주의(attention)를 활용하여 계산 비용을 크게 줄이고 최신 성능을 달성하는 생물학적으로 영감을 얻은 인코더-디코더 아키텍처인 TDANet을 제안한다. 전역 주의 모듈과 계단식 국소 주의 레이어를 통합함으로써 TDANet은 MACs를 5%로 줄이고 CPU 추론 시간을 Sepformer의 10%로 줄였으며, 세 가지 벤치마크 데이터셋에서 경쟁 가능한 분리 품질을 유지한다.

ABSTRACT

Deep neural networks have shown excellent prospects in speech separation tasks. However, obtaining good results while keeping a low model complexity remains challenging in real-world applications. In this paper, we provide a bio-inspired efficient encoder-decoder architecture by mimicking the brain's top-down attention, called TDANet, with decreased model complexity without sacrificing performance. The top-down attention in TDANet is extracted by the global attention (GA) module and the cascaded local attention (LA) layers. The GA module takes multi-scale acoustic features as input to extract global attention signal, which then modulates features of different scales by direct top-down connections. The LA layers use features of adjacent layers as input to extract the local attention signal, which is used to modulate the lateral input in a top-down manner. On three benchmark datasets, TDANet consistently achieved competitive separation performance to previous state-of-the-art (SOTA) methods with higher efficiency. Specifically, TDANet's multiply-accumulate operations (MACs) are only 5\% of Sepformer, one of the previous SOTA models, and CPU inference time is only 10\% of Sepformer. In addition, a large-size version of TDANet obtained SOTA results on three datasets, with MACs still only 10\% of Sepformer and the CPU inference time only 24\% of Sepformer.

연구 동기 및 목표

  • 딥 러닝 기반 음성 분리 방법에서 높은 모델 복잡도 문제를 해결함으로써, 특히 엣지 디바이스에의 배포를 위한 고려사항을 다루기 위해.
  • 인간의 뇌 가공 방식에서 영감을 얻은 상향식 주의 메커니즘이 성능을 희생시키지 않고도 효율성을 향상시킬 수 있는지 탐색하기 위해.
  • 계산 비용을 크게 줄이면서도 높은 정확도를 유지하는 경량이지만 강력한 음성 분리 모델을 설계하기 위해.
  • 상향식 주의가 점점 더 복잡해지는 트랜스포머 기반 아키텍처에 비해 더 효율적인 대안이 될 수 있음을 보여주기 위해.

제안 방법

  • TDANet는 하향식, 상향식, 횡방향 연결을 갖춘 인코더-디코더 아키텍처를 사용하여 뇌의 계층적 감각 처리 방식을 모방한다.
  • 전역 주의(GA) 모듈은 다중 척도 음향 특징에서 상향식 주의 신호를 추출하고, 다양한 척도의 특징을 조절한다.
  • 계단식 국소 주의(LA) 레이어는 인접 레이어의 특징을 사용하여 국소 주의 신호를 생성하고, 상향식 방식으로 횡방향 입력을 조절한다.
  • 인코더는 커널 크기 5, 스트라이드 2의 깊이분할 컨벌루션을 사용하고, 그 다음에 게이팅된 선형 유닛(GLN)을 적용하여 특징을 다운샘플링한다.
  • 디코더는 최소 거리 이웃 보간법을 사용하고 LA 레이어를 통해 고해상도 특징을 복원하며, 적응형 조절을 위한 학습 가능한 파라미터를 갖춘다.
  • 모델는 분리 품질을 최적화하기 위한 손실 함수를 사용하여 엔드 투 엔드로 훈련되며, 효율성은 MACs, GPU/CPU 추론 시간, 파라미터 수로 측정된다.

실험 결과

연구 질문

  • RQ1신경과학에서 유래한 상향식 주의 메커니즘이 딥 러닝 기반 음성 분리 모델의 효율성을 향상시킬 수 있는가?
  • RQ2모델 복잡도와 추론 비용을 크게 줄이면서도 최신 성능을 달성할 수 있는가?
  • RQ3기본적인 트랜스포머 기반 아키텍처와 비교했을 때 생물학적으로 영감을 얻은 주의 메커니즘은 성능과 효율성 측면에서 어떻게 다른가?
  • RQ4상향식 주의를 갖춘 경량 모델이 정확도와 계산 효율성 양면에서 기존 최신 모델을 능가할 수 있는가?

주요 결과

  • TDANet는 LRS2-2Mix, Libri2Mix, WHAM! 데이터셋에서 경쟁 가능한 분리 성능을 달성했으며, 각각 SI-SNRi가 13.2, 16.9, 14.8로 이전 최신 모델과 동일하거나 이를 초월했다.
  • TDANet는 MACs를 오직 Sepformer의 5%로 줄였고, CPU 추론 시간도 Sepformer의 10%로 줄였으며, 높은 성능을 유지했다.
  • TDANet Large 버전은 세 데이터셋에서 모두 최신 성능을 기록했으며, MACs는 Sepformer의 10%, CPU 추론 시간은 24%였다.
  • TDANet는 A-FRCNN과 SuDORM-RF보다 추론 속도가 빨라, GPU 추론 시간은 각각 19%와 18%, CPU 추론 시간은 각각 15%와 46%였다.
  • 훈련 시간 또한 감소했으며, DPTNet 및 Sepformer 대비 역전파 시간은 각각 13%와 47%로 줄었다.
  • 모델는 강력한 저지연(카usal) 성능을 보였으며, SuDORM-RF와 A-FRCNN과 같은 경량 모델보다 카usal 환경에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.