Skip to main content
QUICK REVIEW

[논문 리뷰] Encoder-Decoder Based Attractor Calculation for End-to-End Neural Diarization.

Shota Horiguchi, Yusuke Fujita|arXiv (Cornell University)|2021. 06. 20.
Speech Recognition and Synthesis참고 문헌 54인용 수 4
한 줄 요약

이 논문은 순차적 인코더-디코더 아키텍처를 기반으로 한 애트랙터 계산(EDA) 모듈을 제안하여 엔드 투 엔드 신경 음성 분할(EEND)에 활용함으로써, LSTM 시퀀스-투-시퀀스 모델을 통해 반복적으로 스피커별 애트랙터를 생성함으로써 유연한 스피커 수 추정이 가능하게 한다. 이 방법은 오버랩 처리 성능을 향상시키고 시뮬레이션 및 실제 데이터셋에서 파이프라인 방법보다 뛰어난 성능을 달성한다.

ABSTRACT

This paper investigates an end-to-end neural diarization (EEND) method for an unknown number of speakers. In contrast to the conventional pipeline approach to speaker diarization, EEND methods are better in terms of speaker overlap handling. However, EEND still has a disadvantage in that it cannot deal with a flexible number of speakers. To remedy this problem, we introduce encoder-decoder-based attractor calculation module (EDA) to EEND. Once frame-wise embeddings are obtained, EDA sequentially generates speaker-wise attractors on the basis of a sequence-to-sequence method using an LSTM encoder-decoder. The attractor generation continues until a stopping condition is satisfied; thus, the number of attractors can be flexible. Diarization results are then estimated as dot products of the attractors and embeddings. The embeddings from speaker overlaps result in larger dot product values with multiple attractors; thus, this method can deal with speaker overlaps. Because the maximum number of output speakers is still limited by the training set, we also propose an iterative inference method to remove this restriction. Further, we propose a method that aligns the estimated diarization results with the results of an external speech activity detector, which enables fair comparison against pipeline approaches. Extensive evaluations on simulated and real datasets show that EEND-EDA outperforms the conventional pipeline approach.

연구 동기 및 목표

  • 엔드 투 엔드 신경 음성 분할(EEND) 기술이 알려지지 않은 변동하는 수의 스피커를 처리하는 데에 한계가 있음을 해결한다.
  • 기존 EEND 방법에서 고정된 스피커 수에 의한 유연성 부족 문제를 해결하기 위해 동적 애트랙터 생성을 가능하게 한다.
  • 다중 애트랙터를 활용해 오버랩된 임베딩과의 내적곱을 증폭시킴으로써 스피커 오버랩 탐지 성능을 향상시킨다.
  • 외부 음성 활동 탐지 결과와 일치시킴으로써 파이프라인 기반 시스템과의 공정한 비교를 가능하게 한다.
  • 학습 데이터 제약 조건을 초월해 탐지 가능한 스피커 수의 상한선을 확장하기 위해 반복적 추론 방법을 도입한다.

제안 방법

  • LSTM 인코더-디코더 아키텍처를 활용해 스피커별 애트랙터를 순차적으로 생성하는 인코더-디코더 기반의 애트랙터 계산(EDA) 모듈을 도입한다.
  • 프레임 단위 임베딩을 입력으로 사용하고 정지 조건을 만족할 때까지 반복적으로 애트랙터를 생성함으로써 다이나믹한 스피커 수 추정이 가능해진다.
  • 임베딩과 생성된 애트랙터 간의 내적곱을 통해 분할 결과를 추정하며, 오버랩된 스피커 임베딩은 다중 애트랙터와 일치할 경우 더 높은 점수를 기록한다.
  • 학습 데이터에서 관찰된 제약을 초월해 최대 탐지 가능한 스피커 수를 늘리기 위해 반복적 추론 전략을 구현한다.
  • 예측된 분할 결과를 외부 음성 활동 탐지 결과와 정렬함으로써 파이프라인 기반 시스템과의 공정한 평가를 보장한다.
  • 애트랙터 생성과 분할 정확도 최적화를 위해 시퀀스-투-시퀀스 손실을 사용해 EEND-EDA 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 분할 시스템이 스피커 수를 사전에 알지 못한 채 알려지지 않은 수의 스피커를 다이나믹하게 추정할 수 있는가?
  • RQ2인코더-디코더 기반의 애트랙터 생성 메커니즘이 기존 EEND 방법에 비해 스피커 오버랩을 얼마나 효과적으로 처리할 수 있는가?
  • RQ3반복적 추론 전략이 EEND 시스템에서 실용적인 스피커 수 제한을 어느 정도까지 확장할 수 있는가?
  • RQ4공정한 조건에서 평가했을 때 제안된 방법이 파이프라인 방법과 성능 상 동등하거나 슈퍼리어한 성능을 달성할 수 있는가?
  • RQ5애트랙터 기반 내적곱 점수화 방식이 오버랩된 음성 상황에서 분할 정확도를 얼마나 향상시키는가?

주요 결과

  • EEND-EDA 모델은 시뮬레이션 및 실제 음성 분할 데이터셋 모두에서 기존의 파이프라인 방법을 능가하는 성능을 보였다.
  • 애트랙터 생성 메커니즘이 오버랩된 임베딩과 다중 애트랙터가 일치할 경우 내적곱 점수를 높게 만들어 스피커 오버랩을 성공적으로 처리하였다.
  • 반복적 추론 전략은 학습 중 관찰된 제한을 초월해 최대 탐지 가능한 스피커 수를 효과적으로 확장하였다.
  • 외부 음성 활동 탐지 결과와의 정렬을 통해 파이프라인 기반 시스템과의 공정하고 일관된 벤치마킹이 가능했다.
  • EEND-EDA 프레임워크는 변동하는 스피커 수와 복잡한 오버랩 상황을 다루는 데 있어 뛰어난 강건성과 유연성을 보였다.
  • 시퀀스-투-시퀀스 애트랙터 생성 과정을 통해 미리 알 수 없는 스피커 수에 대한 일반화 능력 향상이 가능한 엔드 투 엔드 훈련이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.