Skip to main content
QUICK REVIEW

[논문 리뷰] Single-Channel Multi-talker Speech Recognition with Permutation Invariant Training

Yanmin Qian, Xuankai Chang|arXiv (Cornell University)|2017. 07. 19.
Speech Recognition and Synthesis인용 수 3
한 줄 요약

이 논문은 단일 채널 다화자 음성 인식을 위한 순열 치환 훈련(PIT) 기반 접근법을 제안하며, 종합적인 엔드 투 엔드 프레임워크에서 화자 분리와 인식을 동시에 최적화한다. MSE를 사용한 프론트엔드 특징 분리와 교차 엔트로피를 사용한 백엔드 ASR에 모두 PIT를 적용함으로써 레이블 순열 문제를 효과적으로 해결하며, 두 화자 혼합 음성에서는 45.0%, 세 화자 혼합 음성에서는 25.0%의 상대적 WER 감소를 달성하였고, 화자 수에 관계없이 뛰어난 일반화 성능을 보였다.

ABSTRACT

Although great progresses have been made in automatic speech recognition (ASR), significant performance degradation is still observed when recognizing multi-talker mixed speech. In this paper, we propose and evaluate several architectures to address this problem under the assumption that only a single channel of mixed signal is available. Our technique extends permutation invariant training (PIT) by introducing the front-end feature separation module with the minimum mean square error (MSE) criterion and the back-end recognition module with the minimum cross entropy (CE) criterion. More specifically, during training we compute the average MSE or CE over the whole utterance for each possible utterance-level output-target assignment, pick the one with the minimum MSE or CE, and optimize for that assignment. This strategy elegantly solves the label permutation problem observed in the deep learning based multi-talker mixed speech separation and recognition systems. The proposed architectures are evaluated and compared on an artificially mixed AMI dataset with both two- and three-talker mixed speech. The experimental results indicate that our proposed architectures can cut the word error rate (WER) by 45.0% and 25.0% relatively against the state-of-the-art single-talker speech recognition system across all speakers when their energies are comparable, for two- and three-talker mixed speech, respectively. To our knowledge, this is the first work on the multi-talker mixed speech recognition on the challenging speaker-independent spontaneous large vocabulary continuous speech task.

연구 동기 및 목표

  • 단일 채널 입력에서 화자 신원이 모호한 다화자 혼합 음성 인식의 과제를 해결하기 위해.
  • 딥 러닝 기반 다화자 ASR 시스템에서 발생하는 레이블 순열 문제를 극복하여 신뢰할 수 있는 훈련과 추론을 가능하게 하기 위해.
  • 명시적인 분리 단계 없이 특징 분리와 음성 인식을 동시에 최적화하는 통합 엔드 투 엔드 아키텍처를 개발하기 위해.
  • 실제 조건에서 화자 독립적이고 자연스러운 대용량 어휘 연속 음성 작업에 대해 모델을 평가하기 위해.
  • 다른 수의 화자로 구성된 혼합 음성에 대해 일반화 능력을 입증하기 위해, 세 화자 모델을 사용해 두 화자 혼합 음성을 인식하는 데 응용해보기 위해.

제안 방법

  • 프론트엔드 특징 분리와 백엔드 ASR 양쪽에 순열 치환 훈련(PIT)을 적용하며, 각각 최소 평균 제곱 오차(MSE) 및 최소 교차 엔트로피(CE) 기준을 사용한다.
  • 각 음성 샘플에 대해 모든 가능한 출력-타겟 화자 할당 조합에 대해 손실를 계산하고, 최소 오차를 가진 조합을 선택해 최적화한다.
  • 명시적인 음성 분리를 생략하고 각 화자에 대한 세노네 포스터리어를 직접 예측하는 직접적인 PIT-CE-ASR 모델을 도입한다.
  • 통합 훈련 목표 아래 프론트엔드 분리와 백엔드 인식을 결합한 공동 최적화 아키텍처를 사용한다.
  • 단일 채널 혼합 음성 입력을 사용하며, 사전 화자 정보 없이 심층 신경망을 활용해 화자별 특징 표현을 모델링한다.
  • 두 화자 및 세 화자 시나리오를 모두 포함한 인위적으로 혼합된 AMI 데이터셋에서 모델을 평가하며, 음성 에너지 수준과 성별 조합을 다양하게 설정한다.

실험 결과

연구 질문

  • RQ1순열 치환 훈련이 음성 분리에서 엔드 투 엔드 다화자 음성 인식으로 효과적으로 확장될 수 있는가?
  • RQ2PIT를 통한 특징 분리와 ASR의 공동 최적화가 별도의 훈련 단계보다 성능을 향상시키는가?
  • RQ3학습 시킨 화자 수와 다른 수의 화자로 구성된 혼합 음성에 대해 제안된 모델이 어떻게 일반화되는가?
  • RQ4어려운 다화자 환경에서 최신 단일 화자 ASR 시스템에 비해 제안된 방법이 어떤 성능 향상을 보이는가?
  • RQ5다른 음성 에너지 수준과 성별 조합에서도 모델이 안정성을 유지하는가?

주요 결과

  • 제안된 직접적 PIT-CE-ASR 모델은 동일한 화자 에너지 조건에서 두 화자 혼합 음성에서 최신 단일 화자 ASR 시스템 대비 45.0%의 상대적 단어 오류률(WER) 감소를 달성하였다.
  • 세 화자 혼합 음성에서는 동일한 에너지 조건 하에서 모든 화자에 대해 25.0%의 상대적 WER 감소를 달성하였다.
  • 세 화자 PIT-CE-ASR 모델은 두 화자 혼합 음성으로도 잘 일반화되어 전용 두 화자 모델과 거의 동일한 WER을 기록하였으며, 화자 수 변화에 대한 강건성을 보였다.
  • 다른 성별 조합의 혼합 음성(예: 64.80% WER)에서는 같은 성별 혼합 음성(예: 69.78% WER)보다 성능이 뛰어나 성별 다양성이 인식에 도움이 된다는 것을 시사한다.
  • 저 SNR 조건에서도 모델은 강건한 성능을 유지하였으며, 세 화자 혼합 음성에서 각각 15dB 및 20dB SNR일 때 WER이 72.88% 및 81.63%로 나타났다.
  • 저자들에 따르면, 이는 단일 채널 입력에서 화자 독립적이고 자연스럽고 대용량 어휘 연속 음성 작업을 위한 첫 번째 성공적인 엔드 투 엔드 인식 시스템이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.