Skip to main content
QUICK REVIEW

[논문 리뷰] Streaming Small-Footprint Keyword Spotting using Sequence-to-Sequence Models

Yanzhang He, Rohit Prabhavalkar|arXiv (Cornell University)|2017. 10. 26.
Speech Recognition and Synthesis참고 문헌 35인용 수 4
한 줄 요약

이 논문은 새로운 주의 기반 키워드 바이어스 기법을 사용한 순환 신경망 트랜스듀서(RNN-T)를 활용해 스트리밍 및 소형 포트폴리오 키워드 스로팅 시스템을 제안한다. RNN-T 모델은 음성 및 언어 모델링을 공동으로 학습하며, 음소 타깃과 종료어 단어 토큰을 통해 기존 강력한 CTC 기반 베이스라인 대비 1시간당 0.05회의 잘못된 경고를 기준으로 39% 감소한 거짓 기각률(8.9% 대비 14.5%)을 달성한다.

ABSTRACT

We develop streaming keyword spotting systems using a recurrent neural network transducer (RNN-T) model: an all-neural, end-to-end trained, sequence-to-sequence model which jointly learns acoustic and language model components. Our models are trained to predict either phonemes or graphemes as subword units, thus allowing us to detect arbitrary keyword phrases, without any out-of-vocabulary words. In order to adapt the models to the requirements of keyword spotting, we propose a novel technique which biases the RNN-T system towards a specific keyword of interest. Our systems are compared against a strong sequence-trained, connectionist temporal classification (CTC) based "keyword-filler" baseline, which is augmented with a separate phoneme language model. Overall, our RNN-T system with the proposed biasing technique significantly improves performance over the baseline system.

연구 동기 및 목표

  • 모바일 배포에 적합한 스트리밍 및 저자원 키워드 스로팅 시스템을 개발하기 위해.
  • 음소나 그래프음처럼 서브워드 유닛을 사용하여 OOV(외부 어휘 어휘) 문제가 없는 임의의 키워드 탐지 기능을 제공하기 위해.
  • RNN-T 아키텍처 내에서 새로운 주의 기반 바이어스 메커니즘을 활용해 특정 키워드의 탐지 정확도를 향상시키기 위해.
  • 스트리밍 KWS 환경에서 RNN-T 모델의 음소 타깃과 그래프음 타깃을 사용한 학습 성능을 평가하기 위해.
  • 외부 언어 모델을 갖춘 강력한 CTC 기반 키워드 필러 베이스라인과 비교하기 위해 제안된 RNN-T 시스템의 성능을 평가하기 위해.

제안 방법

  • 시스템은 순환 신경망 트랜스듀서(RNN-T)를 사용하여 음성 및 언어 구성 요소를 공동으로 모델링하는 엔드 투 엔드 시퀀스-투-시퀀스 학습을 수행한다.
  • 모델은 서브워드 유닛으로 음소 또는 그래프음을 예측하도록 훈련되어, OOV 문제 없이 임의의 키워드 탐지가 가능하다.
  • 새로운 키워드 바이어스 기법은 추론 중 특정 키워드에 모델 예측을 집중시키는 주의 메커니즘을 사용한다.
  • 바이어스 메커니즘은 학습 가능한 <eokw> 토큰을 도입하고, 디코딩 중 키워드의 음소 시퀀스 쪽으로 주의 가중치를 조정한다.
  • 키워드 예측의 종료를 알리는 데 사용되는 종료어 단어(<eow>) 토큰은 이 토큰이 없는 모델보다 성능 향상을 이룬다.
  • 시스템은 표준 KWS 테스트 세트를 사용해 평가되며, 거짓 기각률(FR) 및 시간당 거짓 경고율(FA) 등의 지표를 사용한다.

실험 결과

연구 질문

  • RQ1RNN-T 기반의 시퀀스-투-시퀀스 모델은 스트리밍 및 저발량 포트폴리오 환경에서 경쟁 가능한 키워드 스로팅 성능을 달성할 수 있는가?
  • RQ2RNN-T 모델에서 음소 타깃과 그래프음 타깃을 사용한 학습이 키워드 스로팅 정확도에 어떤 영향을 미치는가?
  • RQ3제안된 주의 기반 키워드 바이어스 메커니즘이 강력한 CTC 기반 베이스라인 대비 거짓 기각률을 유의미하게 감소시키는가?
  • RQ4<eow> 토큰은 RNN-T의 키워드 스로팅 성능에 어떤 영향을 미치는가?
  • RQ5긍정적 및 부정적 키워드 발화에서 모델의 주의 행동은 어떻게 다를까?

주요 결과

  • 음소 타깃을 사용하고 <eow> 토큰을 적용한 RNN-T 모델은 1시간당 0.05회의 잘못된 경고를 기준으로 11.1%의 거짓 기각률을 기록하며, CTC 기반 베이스라인을 능가한다.
  • 제안된 키워드 바이어스 기법은 1시간당 0.05회의 FAs 기준으로 거짓 기각률을 8.9%로 낮춰, 베이스라인 대비 39%의 상대적 향상을 이룬다.
  • 그래프음 타깃을 사용한 RNN-T 모델은 음소 기반 모델보다 성능이 열 劣하므로, 어순 정규화 이전에는 15.5%의 거짓 기각률을 기록했고, 이후에는 14.0%로 감소하였다.
  • 바이어스가 적용된 RNN-T 시스템의 주의 메커니즘은 긍정적 발화에서 키워드 음소에 명확히 집중되며, 주의 가중치에 대각선 패턴을 보였다.
  • 부정적 발화에서는 주의가 키워드의 초기 음소와 <n/a> 토큰에 산산이 흩어져 있어 키워드에 대한 결정을 내리지 못하는 것으로 나타났다.
  • 키워드별 거짓 기각률 히스토그램을 분석한 결과 대부분의 키워드가 15% 이하에 위치해 있으며, 소수의 이상치만 존재하여 다양한 키워드에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.