Skip to main content
QUICK REVIEW

[논문 리뷰] An investigation of phone-based subword units for end-to-end speech recognition

Weiran Wang, Guangsen Wang|arXiv (Cornell University)|2020. 04. 08.
Speech Recognition and Synthesis참고 문헌 38인용 수 11
한 줄 요약

이 논문은 끝말잇기 기반 바이트 쌍 인코딩(BPE)을 종단 간 음성 인식을 위한 서브워드 단위로 제안하며, 발음 사전과 다중 수준 언어 모델을 활용하여 정확도를 향상시킨다. 새로운 일회성 동시 비트 서치를 통해 전화 기반 및 문자 기반 BPE 시스템을 통합함으로써 Switchboard에서 6.3%/13.3% WER, Fisher+Switchboard에서 4.9% WER의 최신 기준 성능을 달성한다.

ABSTRACT

Phones and their context-dependent variants have been the standard modeling units for conventional speech recognition systems, while characters and subwords have demonstrated their effectiveness for end-to-end recognition systems. We investigate the use of phone-based subwords, in particular, byte pair encoder (BPE), as modeling units for end-to-end speech recognition. In addition, we also developed multi-level language model-based decoding algorithms based on a pronunciation dictionary. Besides the use of the lexicon, which is easily available, our system avoids the need of additional expert knowledge or processing steps from conventional systems. Experimental results show that phone-based BPEs tend to yield more accurate recognition systems than the character-based counterpart. In addition, further improvement can be obtained with a novel one-pass joint beam search decoder, which efficiently combines phone- and character-based BPE systems. For Switchboard, our phone-based BPE system achieves 6.8\%/14.4\% word error rate (WER) on the Switchboard/CallHome portion of the test set while joint decoding achieves 6.3\%/13.3\% WER. On Fisher + Switchboard, joint decoding leads to 4.9\%/9.5\% WER, setting new milestones for telephony speech recognition.

연구 동기 및 목표

  • 전화 기반 서브워드 단위, 특히 BPE가 문자 기반 서브워드에 비해 종단 간 음성 인식 성능을 향상시킬 수 있는지 조사하는 것.
  • 전화 기반 BPE 시퀀스 디코딩을 위한 서브워드 및 어절 수준 언어 모델링을 통합하는 다중 수준 언어 모델을 개발하는 것.
  • 전화 기반 및 문자 기반 BPE 시스템의 출력을 융합하는 효율적인 일회성 동시 비트 서치 디코더를 설계하는 것.
  • 전문가가 제공하는 발음 지식이나 복잡한 사전 처리 단계 없이도 종단 간 시스템의 단순성을 유지하는 것.
  • 외부 언어 모델이나 광범위한 튜닝에 의존하지 않고도 Switchboard 및 Fisher 벤치마크에서 최신 기준 성능을 달성하는 것.

제안 방법

  • 발음 사전에서 유도된 전화 시퀀스에 BPE 알고리즘을 적용하여 전화 기반 BPE를 추출하고, 전화를 서브워드 단위로 간주한다.
  • 하이브리드 CTC/attention 손실을 사용하여 전화 BPE 타겟을 기반으로 음성 모델을 훈련시켜, 맥락 의존 전화 모델링 없이 종단 간 학습을 유지한다.
  • 비트 서치 중 얕은 융합을 통해 서브워드 수준 및 어절 수준 언어 모델 점수를 통합하는 프리픽스 트리 기반의 다중 수준 언어 모델을 구축한다.
  • 어휘의 발음 구조를 전화 BPE 시퀀스로 효율적인 디코딩을 위해 탐색 가능한 방식으로 일관되게 분해하는 그릿 디코딩 방법을 구현한다.
  • 가중치 조합을 사용하여 전화 기반 및 문자 기반 BPE 시스템의 가설을 동적으로 융합하는 일회성 동시 비트 서치 디코더를 설계한다.
  • 디코딩 과정에서 전화 BPE 시퀀스를 어휘로 다시 변환하기 위해 발음 사전 조회를 활용하여 동음이의어에 의한 모호함을 방지한다.

실험 결과

연구 질문

  • RQ1전화 기반 서브워드 단위, 예를 들어 BPE가 종단 간 음성 인식에서 문자 기반 서브워드에 비해 우수한 성능을 낼 수 있는가?
  • RQ2다중 수준 언어 모델은 전화 기반 BPE 디코딩을 위해 서브워드 및 어절 수준 언어 모델링을 효과적으로 통합할 수 있는가?
  • RQ3일회성 동시 비트 서치 디코더는 전화 기반 및 문자 기반 BPE 시스템을 효율적으로 융합하여 인식 정확도를 향상시킬 수 있는가?
  • RQ4전화 기반 BPE의 사용은 발음 사전 학습이나 HMM/GMM 구성 요소가 필요 없이 종단 간 시스템의 단순성을 유지하는가?
  • RQ5Switchboard 및 Fisher와 같은 표준 벤치마크에서 전화 기반 및 문자 기반 BPE 시스템 간의 공동 디코딩은 어떤 성능 향상을 가져오는가?

주요 결과

  • 전화 기반 BPE 시스템은 Switchboard/CALLHome 테스트 세트에서 6.8%/14.4% WER를 기록하며, 문자 기반 BPE 시스템을 능가한다.
  • 전화 기반 및 문자 기반 BPE 시스템 간의 공동 디코딩은 Switchboard에서 WER를 6.3%/13.3%로 감소시켜 이 설정에서 새로운 최고 기록을 수립한다.
  • 추가로 Fisher 코퍼스 데이터를 활용하면, Switchboard 부분에서 4.9% WER를 달성하여 이전에 큰 앙상블 모델들조차도 뛰어넘는 결과를 얻는다.
  • 전화 기반 BPE 시스템은 $k=75$일 때 문자 기반 시스템과 유사한 성능를 보이나, $k$가 작을수록 유의미하게 뛰어나 성능 일반화 능력이 뛰어나다는 것을 시사한다.
  • 일회성 동시 비트 서치 디코더는 반복적 디코딩이나 복잡한 재순서 정렬 없이도 일관된 성능 향상을 달성하며 효율적으로 두 시스템을 융합한다.
  • 이 방법은 오직 발음 사전에 의존함으로써 종단 간 시스템의 단순성을 유지하며, 발음 질문 세트, 상태 바인딩, HMM/GMM 학습을 모두 회피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.