Skip to main content
QUICK REVIEW

[논문 리뷰] New Insights on Target Speaker Extraction

Mohamed Elminshawi, Wolfgang Mack|arXiv (Cornell University)|2022. 02. 01.
Speech and Audio Processing인용 수 15
한 줄 요약

이 논문은 음성 및 영상 기반 방법을 사용하여 목표 말하기자 추출(SE)에서 보조 정보의 역할을 조사하며, 공통의 이중경로 RNN 아키텍처를 사용한 무지식한 말하기자 분離(SSF)과 비교한다. 결과적으로 보조 정보가 항상 성능을 향상시키지는 않으며, 특히 3명의 말하기자 혼합 환경에서는 그렇지 않다. 또한 시스템의 행동은 훈련 데이터 구성과 보조 신호 품질에 크게 의존한다.

ABSTRACT

Speaker extraction (SE) aims to segregate the speech of a target speaker from a mixture of interfering speakers with the help of auxiliary information. Several forms of auxiliary information have been employed in single-channel SE, such as a speech snippet enrolled from the target speaker or visual information corresponding to the spoken utterance. The effectiveness of the auxiliary information in SE is typically evaluated by comparing the extraction performance of SE with uninformed speaker separation (SS) methods. Following this evaluation protocol, many SE studies have reported performance improvement compared to SS, attributing this to the auxiliary information. However, such studies have been conducted on a few datasets and have not considered recent deep neural network architectures for SS that have shown impressive separation performance. In this paper, we examine the role of the auxiliary information in SE for different input scenarios and over multiple datasets. Specifically, we compare the performance of two SE systems (audio-based and video-based) with SS using a common framework that utilizes the recently proposed dual-path recurrent neural network as the main learning machine. Experimental evaluation on various datasets demonstrates that the use of auxiliary information in the considered SE systems does not always lead to better extraction performance compared to the uninformed SS system. Furthermore, we offer insights into the behavior of the SE systems when provided with different and distorted auxiliary information given the same mixture input.

연구 동기 및 목표

  • 공통의 딥러닝 아키텍처를 사용하여 직접적으로 무지식한 말하기자 분리(SSF)와 비교함으로써 보조 정보의 효과성을 재평가하는 것.
  • 다양한 데이터셋과 혼합 조건에서 음성 기반(SE-A) 및 영상 기반(SE-V) SE 시스템이 항상 SS를 능가하는지 조사하는 것.
  • 임베딩이 목표 말하기자 외의 말하기자로부터 온 경우를 포함해, 왜곡되거나 일치하지 않는 보조 신호가 제공될 때 SE 시스템의 행동을 분석하는 것.
  • 특히 혼합물에 포함된 말하기자 수를 포함한 훈련 전략이 SE에서 보조 정보를 어떻게 활용하는지에 영향을 미치는지 분석하는 것.
  • 특히 다수의 말하기자가 존재하는 복잡한 환경에서 보조 정보가 항상 SE 성능을 향상시킨다는 가정을 도전하는 것.

제안 방법

  • 모든 SE 및 SS 시스템에 대해 공통의 이중경로 순환 신경망(DPRNN)을 핵심 아키텍처로 사용하여 공정한 비교를 확보한다.
  • SE 시스템을 목표 말하기자 추출을 안내하기 위해 음성 등록 스니펫(SE-A) 또는 시각적 특징(SE-V)을 보조 신호로 사용하여 훈련한다.
  • SDR, SIR, SAR와 같은 표준 지표를 사용하여 성능을 평가하고, 상대적 성과 향상을 평가하기 위해 SS 출력과 오라클 비교를 실시한다.
  • 왜곡된 보조 신호를 사용한 분석 실험을 수행: 목표 말하기자 임베딩을 간섭자 또는 혼합 외의 말하기자 임베딩과 혼합하여 실제 환경의 노이즈와 일치하지 않는 상황을 시뮬레이션한다.
  • 다양한 데이터셋에서 2명의 말하기자 혼합과 3명의 말하기자 혼합에 대해 체계적으로 SE 성능을 비교하여 일반화 능력과 내성 강도를 평가한다.
  • 보조 신호가 목표 말하기자 및 간섭자 말하기자와 유사도가 변할 때 임베딩 공간에서의 시스템 행동을 분석하여, 낮은 유사도 조건에서의 실패 모드를 밝혀낸다.

실험 결과

연구 질문

  • RQ1동일한 딥러닝 아키텍처를 사용할 때, SE에서 보조 정보를 사용하는 것이 무지식한 SS보다 항상 더 나은 성능을 내는가?
  • RQ2보조 신호의 품질과 일치도(예: 목표 말하기자, 간섭자, 또는 혼합 외 말하기자로부터 온 신호)가 SE 시스템의 행동과 출력 품질에 어떻게 영향을 미치는가?
  • RQ3특히 혼합물에 포함된 말하기자 수를 포함한 훈련 데이터 구성이 SE 시스템이 보조 정보를 활용할 수 있는 능력에 어느 정도 영향을 미치는가?
  • RQ4일치하지 않는 보조 정보가 제공될 경우 SE 시스템이 어떤 말하기자도 추출하지 못할 수 있으며, 만약 그렇다면 어떤 조건에서 그러한 상황이 발생하는가?
  • RQ5특히 신호 대 간섭비(SIR)가 낮은 환경에서 보조 정보가 SE에 측정 가능한 이점을 제공하는 조건은 무엇인가?

주요 결과

  • SE에서 보조 정보를 사용한다고 해서 항상 무지식한 SS보다 성능이 향상되는 것은 아니며, 특히 3명의 말하기자 혼합 환경에서는 그 가정이 도전받는다.
  • 2명의 말하기자 혼합에서 훈련된 SE 시스템은 혼합 외(OOM) 말하기자의 임베딩을 제공받더라도 목표 말하기자 또는 간섭자 말하기자를 추출하는 경향이 있어, 일치하지 않는 입력에 대해 강건함을 보인다.
  • 반면 3명의 말하기자 혼합에서 훈련된 SE 시스템은 OOM 임베딩을 제공받을 경우 자주 어떤 말하기자도 추출하지 못하며, 이는 훈련 데이터 구성에 대한 강한 의존성을 드러낸다.
  • 간섭자 말하기자의 임베딩과 혼합하여 보조 신호를 왜곡하면, 정확한 간섭자 임베딩을 사용한 경우와 유사한 성능으로 간섭자 말하기자를 추출하는 결과를 낳을 수 있다.
  • 보조 신호가 상당히 일치하지 않을 경우, 특히 낮은 SIR 조건에서 시스템이 완전히 어떤 말하기자도 추출하지 못할 수 있다.
  • SE-A의 성능은 동일한 목표 말하기자로부터의 다양한 등록 음성에서 거의 일정하게 유지되며, 이는 시스템이 등록 신호의 말하기자 내 변동성에 대해 강건함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.