Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of Any Number of Speakers

Naoyuki Kanda, Yashesh Gaur|arXiv (Cornell University)|2020. 06. 19.
Speech Recognition and Synthesis참고 문헌 33인용 수 5
한 줄 요약

이 논문은 단마이크 중첩 음성에서 동시에 화자 수 세기, 다중화자 ASR, 화자 식별을 수행하는 엔드 투 엔드 통합 모델을 제안한다. 주로 시퀀스 출력 훈련(SOT)에 기반한 어텐션 기반 인코더-디코더 아키텍처를 사용하며, 보조 입력으로 화자 인벤토리(화자 목록)를 도입하고, 모든 구성 요소를 화자 할당 최대 상호정보량 기준으로 최적화함으로써 기준 시스템 대비 29%의 상대적 SA-WER 감소를 달성한다.

ABSTRACT

We propose an end-to-end speaker-attributed automatic speech recognition model that unifies speaker counting, speech recognition, and speaker identification on monaural overlapped speech. Our model is built on serialized output training (SOT) with attention-based encoder-decoder, a recently proposed method for recognizing overlapped speech comprising an arbitrary number of speakers. We extend SOT by introducing a speaker inventory as an auxiliary input to produce speaker labels as well as multi-speaker transcriptions. All model parameters are optimized by speaker-attributed maximum mutual information criterion, which represents a joint probability for overlapped speech recognition and speaker identification. Experiments on LibriSpeech corpus show that our proposed method achieves significantly better speaker-attributed word error rate than the baseline that separately performs overlapped speech recognition and speaker identification.

연구 동기 및 목표

  • 단마이크 중첩 음성에서 화자 수 세기, 다중화자 ASR, 화자 식별을 동시에 수행하는 엔드 투 엔드 통합 모델링의 과제를 해결하기 위해.
  • 음성 분離, ASR, 화자 다이어라이제이션을 별도로 수행하는 캐스케이드 시스템의 한계를 극복하기 위해. 이러한 시스템은 오류 전파로 인해 종종 최적의 성능을 내지 못한다.
  • 변동하는 크기의 화자 프로파일 인벤토리에서 어떤 수의 화자도 포함하는 중첩 음성의 인식을 가능하게 하며, 각 화자를 정확히 식별할 수 있도록 하기 위해.
  • 화자 수 세기, 텍스트 전사, 식별을 모두 하나의 미분 가능한 프레임워크 안에 통합하고, 공동 확률 기반으로 최적화하기 위해.
  • 화자 할당 최대 상호정보량(SA-MMI)을 통한 공동 최적화가 파ipelined 기준 시스템 대비 SA-WER 성능 향상에 기여함을 입증하기 위해.

제안 방법

  • SOT에 기반한 어텐션 기반 인코더-디코더(AED)를 확장하여, 화자 전환 토큰(<sc>)를 사용해 전사 결과를 연결함으로써 임의의 수의 중첩 화자 처리가 가능하도록 한다.
  • 각 프로파일을 기준 음성에서 추출한 d-벡터로 표현하는 화자 인벤토리(화자 목록)를 보조 입력으로 도입한다.
  • 화자 프로파일에 대한 동적 쿼리를 생성하기 위해 화자 쿼리 RNN을 사용하여 화자 식별 정확도를 향상시킨다.
  • 쿼리 벡터를 사용해 화자 프로파일에 대한 어텐션을 적용하고, 화자 인식 디코딩을 위한 컨텍스트 벡터를 생성한다.
  • 디코딩 중 화자 식별 정확도 향상을 위해 어텐션 메커니즘에 가중치가 부여된 화자 프로파일 표현 $\bar{d}_n$ 을 통합한다.
  • 모델의 모든 파라미터를 화자 할당 최대 상호정보량(SA-MMI) 기준으로 공동 최적화하여, 전사 결과와 화자 레이블의 공동 가능도를 최대화한다.
Figure 1: Proposed model.
Figure 1: Proposed model.

실험 결과

연구 질문

  • RQ1통합 엔드 투 엔드 모델이 단마이크 중첩 음성에서 화자 수 세기, 다중화자 ASR, 화자 식별을 동시에 수행할 수 있는가?
  • RQ2SOT에 화자 프로파일을 보조 입력으로 통합함으로써, 별도의 모듈 파이프라인 대비 화자 할당 정확도 향상과 SA-WER 감소를 달성할 수 있는가?
  • RQ3모델의 성능은 증가하는 화자 프로파일 수와 프로파일당 음성 수에 어떻게 영향을 받는가?
  • RQ4복잡하고 다수의 화자가 겹치는 상황에서도 모델이 화자 수를 정확히 세고 각 화자에 올바른 레이블을 할당할 수 있는가?
  • RQ5SA-MMI 기반 공동 최적화가 신호 수준 기준으로 별도로 학습된 구성 요소보다 더 높은 성능을 내는가?

주요 결과

  • 제안된 모델은 SOT-ASR와 d-벡터 기반 화자 식별을 조합한 기준 시스템 대비 29%의 상대적 SA-WER 감소를 달성했다.
  • 1명 화자 케이스에서는 화자 수 세기 정확도가 99.96%, 2명 화자 혼합에서는 97.44%였으며, 3명 화자 케이스에서는 종종 화자 수를 과소 평가하는 경향이 있었다.
  • 화자 프로파일 수가 증가함에 따라 모델의 성능은 안정적으로 유지되었으며, 8개에서 32개로 확장해도 SER과 SA-WER에 미미한 성능 저하만 발생했다.
  • 각 화자 프로파일에 더 많은 음성 샘플을 사용해 프로파일을 추출할수록 오류율이 낮아졌으며, 이는 화자 임베딩 품질 향상과 관련이 있었다.
  • 제거 실험을 통해 화자 쿼리 RNN과 가중치가 부여된 프로파일 표현을 포함한 전체 모델이 변형된 버전보다 우수함을 입증하였으며, 이는 동적 쿼리 생성과 프로파일 정밀화의 중요성을 입증한다.
  • SA-MMI 기반 공동 최적화가 효과적인 엔드 투 엔드 훈련을 가능하게 하여, 무작위 초기화에서 발생하는 수렴 문제를 해결하고 전체 성능 향상에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.