[논문 리뷰] End-to-end Speech Recognition with Word-based RNN Language Models
이 논문은 종단 간 음성 인식(ASR)에서 별도의 문자 기반 언어 모델(LM)이 필요 없도록 하는 동적 레이어 전망 기반의 어휘 기반 RNN 언어 모델을 제안한다. 이는 계산 비용을 감소시키면서도 경쟁력 있는 정확도를 달성한다. 65,000개의 어휘를 사용하여 WSJ Eval'92 셋에서 5.1%의 WER을 달성하여 이전의 종단 간 시스템을 능가한다.
This paper investigates the impact of word-based RNN language models (RNN-LMs) on the performance of end-to-end automatic speech recognition (ASR). In our prior work, we have proposed a multi-level LM, in which character-based and word-based RNN-LMs are combined in hybrid CTC/attention-based ASR. Although this multi-level approach achieves significant error reduction in the Wall Street Journal (WSJ) task, two different LMs need to be trained and used for decoding, which increase the computational cost and memory usage. In this paper, we further propose a novel word-based RNN-LM, which allows us to decode with only the word-based LM, where it provides look-ahead word probabilities to predict next characters instead of the character-based LM, leading competitive accuracy with less computation compared to the multi-level LM. We demonstrate the efficacy of the word-based RNN-LMs using a larger corpus, LibriSpeech, in addition to WSJ we used in the prior work. Furthermore, we show that the proposed model achieves 5.1 %WER for WSJ Eval'92 test set when the vocabulary size is increased, which is the best WER reported for end-to-end ASR systems on this benchmark.
연구 동기 및 목표
- 종단 간 ASR에서 별도의 문자 기반 RNN-LM가 필요 없도록 하여 학습 및 디코딩 오버헤드를 줄이기.
- 다중 수준의 LM 디코딩을 단일 어휘 기반 RNN-LM로 대체하여 디코딩 효율을 향상시키고, 향후 어휘 확률을 통해 다음 문자를 예측하는 전망 기능을 제공하기.
- 계산 및 메모리 비용을 최소화하면서도 다중 수준 LM 시스템과 비교해 경쟁적 또는 더 높은 인식 정확도를 달성하기.
- 다양한 어휘 크기를 가진 WSJ 및 LibriSpeech 벤치마크에서 접근 방식의 타당성을 검증하기.
제안 방법
- 빔 서치 동안 미래 어휘 확률을 사용하여 다음 문자를 예측하는 어휘 기반 RNN-LM에 전망 기능을 도입한다.
- 어휘 기반 RNN-LM가 어휘 경계 뿐 아니라 내부 문자 시퀀스에 대해서도 언어 모델 점수를 제공하여 문자 기반 LM의 역할을 대체한다.
- 디코딩 중에 인코더-디코더 출력과 어휘 기반 RNN-LM을 로그 확률 영역에서 결합하여 얕은 융합을 적용한다.
- 다양한 전망 기능을 갖춘 어휘 기반 RNN-LM를 사용하여 가설을 평가하는 빔 서치 전략을 채택함으로써 별도의 문자 수준 LM가 필요 없도록 한다.
- WSJ 및 LibriSpeech의 음성 텍스트 데이터만을 사용하여 2개의 LSTM 레이어와 각 레이어당 650개의 뉴런을 가진 어휘 기반 RNN-LM를 학습한다.
- 주요 ASR 모델에서 1층의 단방향 LSTM 디코더(300개의 뉴런)와 8층의 양방향 BLSTM 인코더(각 레이어당 320개의 뉴런)를 사용한다.
실험 결과
연구 질문
- RQ1단일 어휘 기반 RNN-LM에 전망 기능을 도입함으로써 문자 기반 및 어휘 기반 LM 모두의 필요성을 제거할 수 있는가?
- RQ2제안된 방법이 계산 비용을 감소시키면서도 다중 수준 LM 시스템과 비교해 유사하거나 더 높은 인식 정확도를 달성할 수 있는가?
- RQ3표준 벤치마크에서 어휘 크기가 증가함에 따라 전망 기능이 내장된 어휘 기반 RNN-LM의 성능은 어떻게 변화하는가?
- RQ4WSJ 및 LibriSpeech와 같은 다양한 데이터셋에서 문자 수준의 LM가 필요 없이도 높은 정확도를 유지할 수 있는가?
주요 결과
- 제안된 전망 기능이 내장된 어휘 기반 RNN-LM는 65,000개의 어휘를 사용하여 WSJ Eval'92 테스트 세트에서 5.1%의 WER를 기록했으며, 이는 이 벤치마크에서 종단 간 ASR로 보고된 바 가장 낮은 WER이다.
- 전망 기능이 내장된 LM를 사용한 디코딩은 어휘 수가 20,000인 다중 수준 LM 대비 40% 감소했고, 65,000인 경우 65% 감소했다.
- 65,000개의 어휘를 사용하더라도 전망 기능이 내장된 LM는 다중 수준 LM의 55%의 디코딩 시간으로 줄였으며, 이는 뚜렷한 효율성 향상을 보였다.
- LibriSpeech에서는 어휘 수가 65,000인 경우 dev clean에서 5.4%, dev other에서 15.6%의 WER를 기록하여 다중 수준 LM와 동등한 성능을 달성했다.
- 별도의 문자 기반 RNN-LM 학습이 필요 없어져 모델 학습 복잡도와 메모리 사용량이 감소했다.
- 전망 기능은 WSJ 및 LibriSpeech 양쪽 모두에서 어휘 크기가 증가할수록 일관된 오류 감소 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.