Skip to main content
QUICK REVIEW

[논문 리뷰] Direct Acoustics-to-Word Models for English Conversational Speech Recognition

Kartik Audhkhasi, Bhuvana Ramabhadran|arXiv (Cornell University)|2017. 03. 22.
Speech Recognition and Synthesis참고 문헌 22인용 수 22
한 줄 요약

이 논문은 스위치보드 및 콜홈 벤치마크에서 영어 대화 음성 인식을 위한 첫 번째 직접 음성-단어 CTC 모델을 제시하며, 언어 모델 또는 디코더 없이도 13.0%/18.8% WER를 달성한다. 텔레폰 CTC 초기화와 GloVe 임베딩을 도입하여 학습을 향상시켰으며, 70%의 발화에서 텔레폰 CTC 성능을 따라잡을 수 있음을 보여주며 더 빠른 추론을 가능하게 한다.

ABSTRACT

Recent work on end-to-end automatic speech recognition (ASR) has shown that the connectionist temporal classification (CTC) loss can be used to convert acoustics to phone or character sequences. Such systems are used with a dictionary and separately-trained Language Model (LM) to produce word sequences. However, they are not truly end-to-end in the sense of mapping acoustics directly to words without an intermediate phone representation. In this paper, we present the first results employing direct acoustics-to-word CTC models on two well-known public benchmark tasks: Switchboard and CallHome. These models do not require an LM or even a decoder at run-time and hence recognize speech with minimal complexity. However, due to the large number of word output units, CTC word models require orders of magnitude more data to train reliably compared to traditional systems. We present some techniques to mitigate this issue. Our CTC word model achieves a word error rate of 13.0%/18.8% on the Hub5-2000 Switchboard/CallHome test sets without any LM or decoder compared with 9.6%/16.0% for phone-based CTC with a 4-gram LM. We also present rescoring results on CTC word model lattices to quantify the performance benefits of a LM, and contrast the performance of word and phone CTC models.

연구 동기 및 목표

  • 스위치보드 및 콜홈과 같은 표준 공개 벤치마크에서 직접 음성-단어 CTC 모델의 성능을 평가하기 위해.
  • 대규모 데이터나 외부 언어 모델 없이도 단어 CTC 모델이 양호한 성능을 낼 수 있는지 조사하기 위해.
  • 단어 CTC와 전통적인 텔레폰 기반 CTC 시스템 간의 데이터 및 학습 복잡성 격차를 줄이기 위해.
  • 단어 CTC와 텔레폰 CTC 모델 간의 오류 유형과 디코딩 효율성을 비교하기 위해.
  • 제한된 데이터 환경에서 단어 CTC 학습 수렴과 성능 향상을 향상시키는 기법들을 탐색하기 위해.

제안 방법

  • 원시 음성 특징을 직접 단어 시퀀스로 매핑하는 엔드 투 엔드 CTC 모델을 학습하여, 텔레폰 또는 문자 중간 단계를 생략한다.
  • 사전 학습된 텔레폰 CTC BLSTM 모델과 계층적 CTC를 사용해 단어 CTC 모델을 초기화하여 최적화를 향상시킨다.
  • 최종 완전 연결 층에 GloVe 단어 임베딩을 통합하여 단어 공시출현 통계를 주입하고 일반화를 도와준다.
  • 언어 모델 통합이 단어 CTC 출력에 미치는 영향을 평가하기 위해 4-그램 언어 모델을 사용한 레이티스 재평가를 수행한다.
  • 재평가를 위해 프레임별 상위-k 가설을 추출하기 위해 공통 레이티스 구축 방법을 사용한다.
  • 레이티스 품질 향상을 위해 단어 로그우도 정규화와 함께 음성 로그-후행도 점수를 적용한다.

실험 결과

연구 질문

  • RQ1언어 모델 또는 디코더 없이도 직접 음성-단어 CTC 모델이 표준 스위치보드 및 콜홈 벤치마크에서 경쟁 가능한 성능을 낼 수 있는가?
  • RQ2학습 데이터가 증가함에 따라 단어 CTC 모델은 어떻게 변화하며, WER와 OOV 비율에 어떤 영향을 미치는가?
  • RQ3텔레폰 CTC 초기화 및 GloVe 임베딩과 같은 기법들이 단어 CTC 학습 수렴과 정확도 향상에 어느 정도 기여하는가?
  • RQ4단어 CTC와 텔레폰 CTC 모델 간의 오류 유형(치환, 삭제, 삽입)은 어떻게 다를까?
  • RQ5언어 모델을 사용한 레이티스 재평가로 단어 CTC와 텔레폰 CTC 시스템 간의 성능 격차를 메울 수 있는가?

주요 결과

  • 단어 CTC 모델은 언어 모델 또는 디코더 없이도 Hub5-2000 스위치보드에서 13.0% WER, 콜홈에서 18.8% WER를 달성했다.
  • 언어 모델이 있는 텔레폰 CTC(9.6%/16.0%)와 비교했을 때, 단어 CTC의 성능 격차는 각각 3.4%포인트와 2.8%포인트였다.
  • 큰 언어 모델을 사용한 레이티스 재평가로 스위치보드와 콜홈에서 각각 WER이 0.5점과 0.8점 절대적으로 감소했다.
  • 단어 CTC 레이티스의 오라클 WER은 스위치보드에서 6.8%, 콜홈에서 11.4%였으며, 향후 향상 가능성을 시사했다.
  • 스위치보드의 72.1%와 콜홈의 74.9%의 테스트 발화에서 단어 CTC 시스템은 텔레폰 CTC 시스템보다 동일하거나 더 적은 오류를 일으켰다.
  • 학습 데이터가 300시간에서 2000시간으로 증가함에 따라 단어 CTC 모델은 7.8%/11.6%의 상대적 WER 향상을 보였고, 이는 텔레폰 CTC 모델(4.3%/8.7%)보다 더 나은 데이터 활용도와 낮은 OOV 비율 덕분이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.