Skip to main content
QUICK REVIEW

[논문 리뷰] An End-to-end Architecture of Online Multi-channel Speech Separation

Jian Wu, Zhuo Chen|arXiv (Cornell University)|2020. 09. 07.
Speech and Audio Processing참고 문헌 27인용 수 4
한 줄 요약

이 논문은 음성 분리, 주의 기반 모듈을 통한 빔 선택, 음성 추출을 공동으로 최적화할 수 있는 학습 가능한 아키텍처로 구성된 엔드 투 엔드 온라인 다중 채널 음성 분리 시스템인 E2E-UFE를 제안한다. 주의 메커니즘을 활용해 빔 선택 모듈을 통해 기울기 전파를 가능하게 함으로써, E2E-UFE는 원래의 모듈형 UFE 시스템과 유사한 오프라인 성능을 달성하고, 블록 온라인 평가에서 12.47% 상대적 WER 감소를 이룩하여 실시간 환경에서의 더 높은 강인성(robustness)을 입증한다.

ABSTRACT

Multi-speaker speech recognition has been one of the keychallenges in conversation transcription as it breaks the singleactive speaker assumption employed by most state-of-the-artspeech recognition systems. Speech separation is consideredas a remedy to this problem. Previously, we introduced a sys-tem, calledunmixing,fixed-beamformerandextraction(UFE),that was shown to be effective in addressing the speech over-lap problem in conversation transcription. With UFE, an inputmixed signal is processed by fixed beamformers, followed by aneural network post filtering. Although promising results wereobtained, the system contains multiple individually developedmodules, leading potentially sub-optimum performance. In thiswork, we introduce an end-to-end modeling version of UFE. Toenable gradient propagation all the way, an attentional selectionmodule is proposed, where an attentional weight is learnt foreach beamformer and spatial feature sampled over space. Ex-perimental results show that the proposed system achieves com-parable performance in an offline evaluation with the originalseparate processing-based pipeline, while producing remark-able improvements in an online evaluation.

연구 동기 및 목표

  • UFE와 같은 모듈형으로 별도 최적화된 음성 분리 시스템의 한계를 해결하기 위해, 간접적인 훈련 목표로 인해 최적 성능에 도달하지 못하는 문제를 해결하고자 한다.
  • 새로운 주의 기반 선택 메커니즘을 통해 빔 선택 모듈을 미분 가능하게 만들어, 다중 채널 음성 분리의 엔드 투 엔드 훈련을 가능하게 하고자 한다.
  • 특히 블록 처리 제약 조건이 존재하는 실시간 음성 분리 시나리오에서의 강인성과 성능 향상을 도모하고자 한다.
  • 실제 음성 녹음 환경에 적합한 저지연 구현을 위해 음성 언믹싱 및 추출 네트워크의 공동 최적화를 달성하고자 한다.

제안 방법

  • UFE의 별도 음성 소스 위치 추정(SSL) 모듈을 대체하기 위해 학습 가능한 주의 기반 선택 모듈을 통합한 엔드 투 엔드 아키텍처인 E2E-UFE를 도입하여, 빔 선택 과정을 통해 기울기 역전파가 가능하도록 한다.
  • 주파수 및 시간에 걸쳐 샘플링된 공간 특징을 바탕으로 고정된 빔포머들에 대한 공간 주의 가중치를 계산하는 미분 가능한 주의 메커니즘을 활용한다.
  • 음성 언믹싱 네트워크의 목적 함수로 순열 불변 훈련(PIT)과 스케일 불변 신호 대 잡음비(Si-SNR)를 사용하여 분리 품질을 향상시킨다.
  • 언믹싱 및 추출 네트워크의 사전 훈련을 수행한 후, 초기 학습률을 낮춘 상태에서 엔드 투 엔드 미세 조정을 통한 공동 훈련 전략을 적용한다.
  • 신경망의 입력 특징으로 짧은 시간 푸리에 변환(STFT) 특징, 로그 크기 스펙트럼, 그리고 마이크 간 위상 차이(cosIPDs)를 사용한다.
  • 실시간 제약 조건을 시뮬레이션하기 위해 2초 또는 4초의 봉우리 컨텍스트를 갖는 더블 버퍼링 기법을 블록 온라인 처리에 적용한다.

실험 결과

연구 질문

  • RQ1기울기 전파가 빔 선택 과정을 통해 가능하도록 하는 엔드 투 엔드 훈련 가능한 아키텍처를 온라인 다중 채널 음성 분리에 대해 설계할 수 있는가?
  • RQ2엔드 투 엔드 훈련을 통한 언믹싱 및 추출 네트워크의 공동 최적화는 별도로 훈련된 모듈형 시스템에 비해 성능을 어떻게 향상시키는가?
  • RQ3실시간 음성 분리에서 오프라인 평가와 온라인 평가 간의 성능 격차는 무엇이며, E2E-UFE는 이를 메우는가?
  • RQ4엔드 투 엔드 훈련은 기존 UFE와 비교해 추론 중 잘못된 빔 선택에 더 강인한가?

주요 결과

  • E2E-UFE는 시뮬레이션 및 반실제 데이터셋 모두에서 원래 UFE 시스템과 유사한 단어 오류율(WER) 성능을 오프라인 평가에서 달성한다.
  • 반실제 데이터셋에서 E2E-UFE는 OV35와 OV75에서 각각 4.8%와 4.3%의 상대적 WER 감소를 기록하여, WER가 33.89%와 35.92%에 도달한다.
  • 블록 온라인 평가에서 E2E-UFE는 시뮬레이션 데이터셋에서 29.71% 상대적 WER 감소를 기록했고, 반실제 데이터셋에서는 평균 12.47% 상대적 WER 감소를 달성했다.
  • 기존 UFE 시스템은 온라인 환경에서 성능이 크게 떨어지며, 시뮬레이션 데이터에서 WER가 16.44%에서 24.10%로 증가했고, 반실제 데이터에서 35.60%에서 44.05%로 상승하여 지연 제약 조건에 매우 취약함을 보였다.
  • E2E-UFE의 강인성은 훈련 중 잘못된 빔 선택에 노출되는 공동 최적화 덕분이며, UFE는 오직 정확한 빔만을 볼 수 있기 때문이다.
  • 두 시스템 모두 스퍼지피케이션 기법을 사용하지 않아 UFE에서는 에너지 누설 문제가 악화되었지만, E2E-UFE의 엔드 투 엔드 최적화가 이를 완화시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.