Skip to main content
QUICK REVIEW

[논문 리뷰] Wake Word Detection with Alignment-Free Lattice-Free MMI

Yiming Wang, Hang Lv|arXiv (Cornell University)|2020. 05. 17.
Speech Recognition and Synthesis참고 문헌 39인용 수 5
한 줄 요약

이 논문은 하이브리드 DNN/HMM 웨이크 워드 검출을 위한 정렬 무관 라티스 자유 최대 상호정보량(LF-MMI) 학습 방법을 제안하며, 학습 중 프레임 수준의 정렬이 필요 없고, 정확도 향상을 위한 전용 침묵 모델을 통합한다. 이 시스템은 세 가지 실세계 데이터셋에서 특정 기준의 거짓 경고율에서 50%~90%의 거짓 기각률 감소를 달성하며, 모델 크기가 작고 학습 과정이 단순한 점에서 이전 방법을 뛰어넘는 성능을 보인다.

ABSTRACT

Always-on spoken language interfaces, e.g. personal digital assistants, rely on a wake word to start processing spoken input. We present novel methods to train a hybrid DNN/HMM wake word detection system from partially labeled training data, and to use it in on-line applications: (i) we remove the prerequisite of frame-level alignments in the LF-MMI training algorithm, permitting the use of un-transcribed training examples that are annotated only for the presence/absence of the wake word; (ii) we show that the classical keyword/filler model must be supplemented with an explicit non-speech (silence) model for good performance; (iii) we present an FST-based decoder to perform online detection. We evaluate our methods on two real data sets, showing 50%--90% reduction in false rejection rates at pre-specified false alarm rates over the best previously published figures, and re-validate them on a third (large) data set.

연구 동기 및 목표

  • 웨이크 워드 검출을 위한 LF-MMI 학습에서 프레임 수준의 정렬에 의존하는 것을 제거하여, 웨이크 워드 존재/부재 표기만 있는 부분 레이블링된 데이터를 사용할 수 있도록 함.
  • 비음성(침묵) HMM 모델을 명시적으로 도입함으로써 검출 성능을 향상시키며, 배경 침묵을 처리하고 거짓 경고를 줄이는 데 핵심적인 역할을 함.
  • 실시간 웨이크 워드 검출에 적합한 효율적인 FST 기반 온라인 디코더를 설계함.
  • 표준어 사전이나 텍스트 자료가 필요 없이 최소한의 아키텍처 복잡성으로 실세계 데이터셋에서 최신 기술 수준의 성능을 입증함.

제안 방법

  • 전체 웨이크 워드를 모델링하기 위해 고정된 상태 수를 가진 단일 HMM을 도입하여, 음소 수준의 HMM을 대체하고 모델 복잡도를 감소시킴.
  • 비음성 음성(침묵)을 모델링하기 위해 발화의 시작과 끝에 선택적 상태로 전용 침묵(SIL) HMM을 도입함으로써 강건성을 향상시킴.
  • 이전 모델이 제공하는 강제 정렬이 필요 없이 가설에서 직접 분자 그래프를 구성함으로써 정렬 무관 LF-MMI 학습을 구현함.
  • 실시간 추론을 위해 웨이크 워드 점수와 필러 점수의 비율을 효율적으로 계산하는 빠른 FST 기반 디코더를 구현함.
  • 프레임 수준의 정확도가 아닌 시퀀스 수준의 검출 성능을 최적화하기 위해 LF-MMI를 이용한 시퀀스 수준의 판별적 학습을 적용함.
  • 정렬 무관 모델이 생성한 정렬을 사용하는 두 번째 단계의 일반 LF-MMI 학습을 통해 반복적 개선을 통해 성능 향상을 이룸.

실험 결과

연구 질문

  • RQ1웨이크 워드 검출을 위한 LF-MMI 학습을 정렬 무관으로 구현할 수 있는가? 성능을 유지하거나 향상시킬 수 있는가?
  • RQ2전용 침묵 모델의 도입이 특히 거짓 경고를 줄이는 데 있어 성능 향상에 상당한 기여를 하는가?
  • RQ3고정된 상태 수를 가진 단일 HMM이 음소 상태 분해 없이 전체 웨이크 워드를 효과적으로 모델링할 수 있는가?
  • RQ4기존의 프레임 수준 정렬 기반 또는 엔드 투 엔드 접근 방식과 비교할 때, 제안된 정렬 무관 LF-MMI 방법은 거짓 기각률과 거짓 경고율 측면에서 어떻게 성능을 내는가?
  • RQ5텍스트 자료나 표준어 사전, 강제 정렬이 필요 없이도 실세계 데이터셋에서 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • 정렬 무관 LF-MMI 방법은 SNIPS 데이터셋에서 거짓 경고율(FAH) 0.5일 때 거짓 기각률(FRR)을 0%로 감소시켜 이전 최고 성능인 0.12% FRR를 뛰어넘었다.
  • Mobvoi 데이터셋에서, 주목할 만한 주목적 기반 방법과 비교해 FAH 1.5일 때 FRR를 90% 상대 감소시켰다(0.4% 대 ~3.6%).
  • Mobvoi(SLR87) 데이터셋에서, 두 웨이크 워드에 대해 FAH=0.5일 때 FRR를 50%~70% 감소시켰다(기준 방법 대비 각각 0.4% 및 0.5%).
  • 전용 침묵 모델의 추가로 성능 향상이 뚜렷하게 이루어졌으며, 특히 음성 톤 변화나 비음성 소리로 인한 거짓 경고를 줄이는 데 기여했다.
  • 정렬 무관 모델이 생성한 정렬을 사용하는 일반 LF-MMI 학습의 보완 단계를 통해 SNIPS에서 FRR를 0.2%에서 0.1%로, Mobvoi에서 0.4%에서 0.3%로 감소시켜 점진적인 성능 향상을 입증했다.
  • 단지 150만 파라미터로도 강력한 성능을 달성하여, 순차 수준의 판별적 기준으로 학습된 작고 간결한 모델이 더 크고 복잡한 아키텍처를 능가할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.