Skip to main content
QUICK REVIEW

[논문 리뷰] Constructing Long Short-Term Memory based Deep Recurrent Neural Networks for Large Vocabulary Speech Recognition

Xiangang Li, Xihong Wu|arXiv (Cornell University)|2014. 10. 16.
Speech Recognition and Synthesis참고 문헌 18인용 수 12
한 줄 요약

이 논문은 대규모 어휘 음성 인식 성능을 향상시키기 위해 새로운 딥 Long Short-Term Memory (LSTM) 아키텍처를 제안한다. 중국어 대화형 전화 음성 작업에서, 특히 LSTM-OP 및 스택드 LSTM 변종을 통해 입력-은닉, 은닉-은닉, 은닉-출력 전이를 심화시켜 LSTM 네트워크를 확장함으로써, 저자들은 최신 기술 수준의 결과를 달성하였으며, CER를 38.01% (DNN)에서 34.65%로 감소시켰다.

ABSTRACT

Long short-term memory (LSTM) based acoustic modeling methods have recently been shown to give state-of-the-art performance on some speech recognition tasks. To achieve a further performance improvement, in this research, deep extensions on LSTM are investigated considering that deep hierarchical model has turned out to be more efficient than a shallow one. Motivated by previous research on constructing deep recurrent neural networks (RNNs), alternative deep LSTM architectures are proposed and empirically evaluated on a large vocabulary conversational telephone speech recognition task. Meanwhile, regarding to multi-GPU devices, the training process for LSTM networks is introduced and discussed. Experimental results demonstrate that the deep LSTM networks benefit from the depth and yield the state-of-the-art performance on this task.

연구 동기 및 목표

  • 시간적 깊이를 초월한 공간적 깊이를 가진 LSTM 네트워크를 깊이 있게 확장하여 음성 인식을 위한 음향 모델링 성능을 향상시키는 것.
  • 대규모 음성 인식 작업에서 LSTM-OP, 스택드 LSTMs, 하이브리드 설계와 같은 대체 딥 LSTM 아키텍처를 평가하는 것.
  • 시퀀스 모델링의 맥락에서 딥 LSTM 네트워크에 대한 멀티-GPU 학습의 효율성과 효과를 조사하는 것.
  • 인식 정확도 측면에서 표준 얕은 LSTMs와 피드포워드 DNNs와의 비교를 통해 딥 LSTM 변종의 성능을 평가하는 것.
  • 계산 비용을 최소화하면서 성능을 극대화하는 최적의 아키텍처 조합을 규명하는 것.

제안 방법

  • 입력-은닉, 은닉-은닉, 은닉-출력 함수의 세 가지 구성 요소를 수정하여 딥 LSTM 변종을 설계한다.
  • 표현 능력을 향상시키기 위해 LSTM-OP(출력 투영) 및 LSTM-IP(입력 투영) 아키텍처를 도입한다.
  • 수렴 속도를 향상시키기 위해 멀티-GPU 시스템에서 단절된 시간에 따른 역전파(BPTT)를 사용한다.
  • LSTM-OP 위에 피드포워드 레이어를 결합한 딥 은닉-은닉 전이와의 하이브리드 모델을 구성하여 성능을 향상시킨다.
  • 시퀀스 모델링과 정합성 향상을 위해 연결주의적 시간 분류(CTC)와 분류 기반 학습을 사용한다.
  • 타임스탬프 제어 및 상태 제어를 향상시키기 위해 메모리 셀에서 피크홀 연결과 tanh 활성화 함수를 사용한다.

실험 결과

연구 질문

  • RQ1시간적 깊이를 초월한 공간적 깊이를 가진 LSTM 네트워크의 깊이를 확장하면 대규모 어휘 음성 인식에서 성능 향상이 이루어지는가?
  • RQ2LSTM-OP, 스택드 LSTMs, 또는 하이브리드 설계 중 어떤 아키텍처 변종이 대규모 대화 음성 작업에서 가장 높은 인식 정확도를 달성하는가?
  • RQ3단어 오류율(WER) 측면에서 딥 LSTM 네트워크의 성능는 표준 얕은 LSTMs와 피드포워드 DNNs와 비교해 어떻게 되는가?
  • RQ4입력-은닉, 은닉-은닉, 출력-은닉 함수를 모두 깊이 있게 조합할 경우 인식 성능에 어떤 영향을 미치는가?
  • RQ5멀티-GPU 학습은 수렴성이나 정확도를 훼손하지 않고 딥 LSTM 네트워크의 학습을 효율적이고 확장 가능하게 할 수 있는가?

주요 결과

  • 세 개의 피드포워드 중간 레이어를 가진 딥 LSTM-OP 네트워크가 가장 뛰어난 성능을 보였으며, CER를 34.65%로 감소시켰다.
  • LSTM-OP 아키텍처는 표준 얕은 LSTMs와 스택드 LSTMs를 모두 초월하여, 얕은 LSTM 대비 13.98% 상대적인 CER 감소를 달성했다.
  • 피드포워드 DNNs(38.01% CER)와 비교해 딥 LSTM 네트워크는 CER를 8.87% 감소시켜 정확도 향상의 뚜렷한 성과를 보였다.
  • LSTM-OP 레이어를 스택(3층)하는 것과 LSTM-IP 레이어를 스택하는 것 중에서, LSTM-OP 스택이 더 높은 성능을 보였지만, 양자 모두 하이브리드 피드포워드 통합에 비해 덜 효과적이었다.
  • 세 개의 피드포워드 레이어를 포함한 LSTM-OP와의 하이브리드 모델이 가장 높은 정확도를 기록했으며, 더 깊은 스택 구조에 비해 계산량도 적었다.
  • 멀티-GPU 학습은 단절된 BPTT를 사용하여 딥 LSTM 네트워크의 효율적이고 확장 가능한 학습을 가능하게 하였으며, 대규모 실험을 지원하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.