Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task Recurrent Model for Speech and Speaker Recognition

Zhiyuan Tang, Lantian Li|arXiv (Cornell University)|2016. 03. 31.
Speech Recognition and Synthesis참고 문헌 18인용 수 9
한 줄 요약

이 논문은 음성 인식(ASR)과 발화자 인식(SRE)을 동시에 학습하기 위해 한 작업의 출력을 다른 작업의 순환 입력으로 제공하는 다중 과제 순환 신경망을 제안한다. 이는 서로의 음성 콘텐츠에 초점이 맞춰진 ASR와 발화자에 초점이 맞춰진 SRE 간의 부정적 상관관계에도 불구하고 상호 보완적 성능 향상을 가능하게 한다. 모델은 WSJ 데이터셋에서 두 과제 모두 최신 기술 수준(SOTA) 성능을 달성하였으며, SRE의 오차율은 전통적인 i-vector/PLDA 시스템을 뛰어넘고, ASR의 WER는 기준 모델 대비 4.8% 감소하였다.

ABSTRACT

Although highly correlated, speech and speaker recognition have been regarded as two independent tasks and studied by two communities. This is certainly not the way that people behave: we decipher both speech content and speaker traits at the same time. This paper presents a unified model to perform speech and speaker recognition simultaneously and altogether. The model is based on a unified neural network where the output of one task is fed to the input of the other, leading to a multi-task recurrent network. Experiments show that the joint model outperforms the task-specific models on both the two tasks.

연구 동기 및 목표

  • 사람의 인지에서 두 과제가 공통된 처리 파이프라인을 공유하고 상호 이점이 있음에도 불구하고, 이를 독립된 과제로 간주하는 데서 비롯되는 한계를 해결하기 위해.
  • ASR는 콘텐츠 중심 특징이 필요하고 SRE는 발화자 중심 특징이 필요한 바, 이 둘 사이의 부정적 상관관계를 극복하기 위해 통합된 학습 프레임워크를 설계하기 위해.
  • 서로 다른 과제 간의 순환 연결을 통해 공동 학습을 실현함으로써, 부정적 상관관계가 존재하더라도 두 과제의 성능을 동시에 향상시킬 수 있음을 입증하기 위해.
  • 한 과제의 순환 정보가 다른 과제를 효과적으로 지도함으로써 일반화 능력과 강인성을 향상시킬 수 있는지 탐색하기 위해.

제안 방법

  • 한 과제의 출력(예: ASR의 발음 후보 확률 또는 SRE의 발화자 후보 확률)을 다음 타임스텝에서 다른 과제의 입력으로 제공하는 통합된 장기 순환 기억망(LSTM) 아키텍처를 설계한다.
  • 한 과제의 순환 은닉 상태를 다른 과제의 입력 게이트, 출력 게이트 또는 비선형 활성화 함수에 보조 입력으로 사용하여 상호 과제 순환을 구현한다.
  • 시간에 따른 동적 특징 학습을 통해 공유된 특징을 학습할 수 있도록 하며, 한 과제의 출력이 다음 타임스텝에서 다른 과제의 처리에 영향을 주도록 한다.
  • 엔드 투 엔드로 학습되며, ASR에는 교차 엔트로피 손실, SRE에는 트리플릿 손실을 사용하여 공동 최적화를 가능하게 한다.
  • 반복 투영 $ r_t $의 피드백이 주요 지도 신호로 사용되며, 다양한 구성에서 피드백의 영향을 평가하기 위해 여러 테스트를 수행한다.
  • 모델은 WSJ 코퍼스에서 평가되며, 피드백 루팅 및 구성 요소 선택에 대한 추론 분석을 통해 성능 향상을 평가한다.

실험 결과

연구 질문

  • RQ1서로 다른 과제 간의 순환 연결을 활용하여 단일 신경망이 음성 인식과 발화자 인식을 동시에 학습할 수 있는가?
  • RQ2서로 다른 과제 간의 부정적 상관관계가 존재하더라도, 한 과제의 출력을 다른 과제의 입력으로 제공함으로써 두 과제의 성능 향상이 가능할 수 있는가?
  • RQ3LSTM의 구성 요소 중에서(입력 게이트, 출력 게이트, 활성화 함수) 어느 것이 파트너 과제의 피드백에서 가장 효과적으로 이득을 보이는가?
  • RQ4공동 모델이 i-vector 및 r-vector 시스템과 같은 강력한 전용 기준 모델보다 ASR 및 SRE 양 측면에서 모두 우수한 성능을 낼 수 있는가?
  • RQ5반복 투영 $ r_t $만으로도 충분한 피드백 신호를 제공하는가, 아니면 추가적인 투영(예: $ i_t $, $ f_t $)이 추가적인 성능 향상에 기여하는가?

주요 결과

  • 피드백이 입력 게이트와 출력 게이트에 적용된 경우, ASR의 단어 오류율(WER)은 기준 모델의 7.41%에서 6.97%로 감소하였다.
  • 최적의 구성에서 SRE의 등가오류율(EER)은 r-vector 기준 모델의 1.84%에서 0.55%로 감소하였으며, i-vector/PLDA 시스템(EER = 0.57%)을 초월하였다.
  • 모든 피드백 구성에서 두 과제의 성능 향상이 일관되게 관찰되어, 아키텍처의 다양성에 대해 강인함을 입증하였다.
  • 반복 투영 $ r_t $의 피드백만으로도 강력한 성능 향상이 발생하여, 이는 필수적인 상호 과제 정보를 효과적으로 캡처하고 있음을 시사한다.
  • 비순환 투영(예: $ i_t $, $ f_t $)을 통합해도 성능 향상이 일관되게 이루어지지 않아, $ r_t $가 가장 효과적인 피드백 신호임을 시사한다.
  • 공동 모델은 ASR 및 SRE 양 측면에서 최신 기술 수준의 성능를 달성하였으며, 부정적 상관관계가 존재하는 과제에 대해 상호 과제 순환의 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.