Skip to main content
QUICK REVIEW

[논문 리뷰] Improving speaker discrimination of target speech extraction with time-domain SpeakerBeam

Marc Delcroix, Tsubasa Ochiai|arXiv (Cornell University)|2020. 01. 23.
Speech and Audio Processing참고 문헌 24인용 수 12
한 줄 요약

이 논문은 동일성별 혼합물에서의 목표 음성 추출에서의 발화자 식별 성능을 향상시키기 위해 시간영역 구현인 SpeakerBeam(TD-SpeakerBeam)을 제안한다. 시간영역 네트워크를 사용하고, 내부 조합을 통한 공간적 특징 통합을 구현하며, 다중 과제 발화자 식별 손실을 적용함으로써, 주파수영역 기반 SpeakerBeam 및 TasNet 기반 베이스라인보다 우수한 성능을 달성하여 최대 1 dB의 SDR 향상을 이끌어내고, 동일성별 및 이질성별 혼합물 간의 성능 격차를 크게 줄였다.

ABSTRACT

Target speech extraction, which extracts a single target source in a mixture given clues about the target speaker, has attracted increasing attention. We have recently proposed SpeakerBeam, which exploits an adaptation utterance of the target speaker to extract his/her voice characteristics that are then used to guide a neural network towards extracting speech of that speaker. SpeakerBeam presents a practical alternative to speech separation as it enables tracking speech of a target speaker across utterances, and achieves promising speech extraction performance. However, it sometimes fails when speakers have similar voice characteristics, such as in same-gender mixtures, because it is difficult to discriminate the target speaker from the interfering speakers. In this paper, we investigate strategies for improving the speaker discrimination capability of SpeakerBeam. First, we propose a time-domain implementation of SpeakerBeam similar to that proposed for a time-domain audio separation network (TasNet), which has achieved state-of-the-art performance for speech separation. Besides, we investigate (1) the use of spatial features to better discriminate speakers when microphone array recordings are available, (2) adding an auxiliary speaker identification loss for helping to learn more discriminative voice characteristics. We show experimentally that these strategies greatly improve speech extraction performance, especially for same-gender mixtures, and outperform TasNet in terms of target speech extraction.

연구 동기 및 목표

  • 발화자 간 음성 특성이 유사할 경우, 특히 동일성별 혼합물에서 목표 음성 추출의 발화자 식별 성능이 열 劣화되는 문제를 해결하기 위해.
  • TasNet와 같은 시간영역 신경망의 장점을 활용하기 위해, 주파수영역에서 시간영역 처리로의 전환을 통해 SpeakerBeam의 성능을 향상시키기 위해.
  • 입력 수준 융합 대신 내부 조합 메커니즘을 통해 마이크 어레이에서 유도된 공간적 특징을 활용하여 발화자 식별 성능을 향상시키기 위해.
  • 음성 복원과 발화자 식별 목표를 융합한 다중 과제 손실을 도입하여 발화자 임베딩의 질을 향상시키기 위해.
  • 특히 발화자 수의 다양성이 발화자 식별 성능에 미치는 영향을 조사하기 위해.

제안 방법

  • 원시 음성 신호를 직접 처리하는 시간영역 구현인 TD-SpeakerBeam를 제안하여 주파수영역 스펙트로그램 대신 시간영역 웨이브포트를 사용한다.
  • 적응 발화에서 더 풍부하고 구분력 있는 발화자 임베딩 벡터를 추출하기 위해 시퀀스 요약 네트워크를 컨볼루션 네트워크로 대체한다.
  • 마이크 어레이에서 유도된 이어간 위상 차이(IPD) 특징을 내부 조합 메커니즘을 통해 통합하여 네트워크 아키텍처 내에서 공간적 특징을 더 효과적으로 활용할 수 있도록 한다.
  • 음성 복원 손실과 발화자 식별 손실(SI-loss)을 융합한 다중 과제 손실을 적용하여 모델이 더 구분력 있는 발화자 임베딩을 학습하도록 유도한다.
  • 이중 단계 학습 전략을 사용한다: 먼저 SI-loss를 사용해 발화자 임베딩 추출기만 미세조정하고, 이후 공동 손실 최적화를 통해 전체 시스템을 훈련시킨다.
  • 단일 마이크 및 다중 마이크 설정 모두에 적용하여, 다양한 성별 조합과 훈련 데이터 스케일에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1TD-SpeakerBeam의 시간영역 구현은 주파수영역 기반 버전보다 목표 음성 추출 성능을 향상시키는가?
  • RQ2내부 조합 메커니즘을 통해 마이크 어레이에서 유도된 공간적 특징을 통합하면, 특히 동일성별 혼합물에서 발화자 식별 성능이 향상되는가?
  • RQ3음성 복원과 발화자 식별을 융합한 다중 과제 손실은 발화자 임베딩의 구분 능력을 향상시키는가?
  • RQ4훈련 데이터의 발화자 수가 목표 음성 추출에서 동일성별 및 이질성별 혼합물 간의 성능 격차에 미치는 영향은 어떠한가?
  • RQ5제안된 방법은 도전적인 조건에서 최신 기술 기반 음성 분리 시스템에 이어 목표 발화자 선택을 수행하는 것보다 우수한 성능을 내는가?

주요 결과

  • TD-SpeakerBeam는 주파수영역 기반 SpeakerBeam(FD-SpeakerBeam) 및 TasNet 기반 베이스라인보다 뛰어난 성능을 보였으며, MC-WSJ0-2mix에서 평균 SDR 11.17 dB를 기록하여 FD-SpeakerBeam의 10.27 dB보다 높았다.
  • TD-SpeakerBeam에서 IPD 특징의 내부 조합은 입력 수준 융합 대비 최대 1 dB의 SDR 향상을 이끌었으며, 평균 SDR 11.45 dB로 가장 우수한 성능 기록.
  • SI-loss 도입으로 일관된 SDR 향상(최대 1 dB)을 기록했으며, 특히 동일성별 혼합물에서 유의미한 향상이 있었고, 937명의 훈련 발화자를 사용할 경우 CSJ-2mix에서 평균 SDR 17.81 dB를 달성.
  • 더 많은 훈련 발화자를 사용할수록 TD-SpeakerBeam의 성능 향상이 뚜렷했으며, 특히 동일성별 혼합물에서 두드러졌고, TasNet의 성능는 거의 변화하지 않았다. 이는 SpeakerBeam가 발화자 다양성에서 더 큰 이점을 얻는다는 것을 시사한다.
  • 동일성별 혼합물에서의 처리 실패(정규화된 SDR 향상 ≤ 0 dB) 비율이 감소했으며, 937명의 훈련 발화자와 SI-loss를 적용했을 때 모든 성별 조합에서 가장 일관되고 견고한 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.