Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Recurrent Convolutional Neural Network: Improving Performance For Speech Recognition

Zewang Zhang, Zheng Sun|arXiv (Cornell University)|2016. 11. 22.
Speech Recognition and Synthesis참고 문헌 37인용 수 17
한 줄 요약

이 논문은 음성 인식에서 학습 효율성과 인식 정확도를 향상시키기 위해 기존의 CNN-RNN 순서를 뒤집어 순환 네트워크를 먼저 두는 새로운 딥 순환 합성곱 신경망(RCNN) 아키텍처를 제안한다. 심층 잔차 학습을 통합함으로써 빠른 수렴과 TIMIT 데이터셋에서 상태 기준의 음소 오류율(PER) 17.33%를 달성한다. 이는 표준 및 잔차 향상 버전의 기준 모델을 모두 능가한다.

ABSTRACT

A deep learning approach has been widely applied in sequence modeling problems. In terms of automatic speech recognition (ASR), its performance has significantly been improved by increasing large speech corpus and deeper neural network. Especially, recurrent neural network and deep convolutional neural network have been applied in ASR successfully. Given the arising problem of training speed, we build a novel deep recurrent convolutional network for acoustic modeling and then apply deep residual learning to it. Our experiments show that it has not only faster convergence speed but better recognition accuracy over traditional deep convolutional recurrent network. In the experiments, we compare the convergence speed of our novel deep recurrent convolutional networks and traditional deep convolutional recurrent networks. With faster convergence speed, our novel deep recurrent convolutional networks can reach the comparable performance. We further show that applying deep residual learning can boost the convergence speed of our novel deep recurret convolutional networks. Finally, we evaluate all our experimental networks by phoneme error rate (PER) with our proposed bidirectional statistical n-gram language model. Our evaluation results show that our newly proposed deep recurrent convolutional network applied with deep residual learning can reach the best PER of 17.33\% with the fastest convergence speed on TIMIT database. The outstanding performance of our novel deep recurrent convolutional neural network with deep residual learning indicates that it can be potentially adopted in other sequential problems.

연구 동기 및 목표

  • 자동 음성 인식(ASR)에서 기존의 깊은 합성곱 순환 네트워크(CRNN)의 느린 수렴과 높은 학습 시간 문제를 해결하기 위해.
  • 순환층을 합성곱층 이전에 두는 아키텍처 재정렬을 통해 인식 정확도와 학습 효율성을 향상시키기 위해.
  • 제안된 아키텍처에서 심층 잔차 학습이 수렴 속도와 인식 성능 향상에 얼마나 효과적인지 조사하기 위해.
  • 이중 통계적 n-그램 언어 모델을 사용하여 제안된 모델을 평가하고, 표준 CRNN 및 잔차 변형과 비교하기 위해.

제안 방법

  • 기존 CRNN 아키텍처의 순서를 뒤집어 순환층을 합성곱층 이전에 두는 새로운 아키텍처인 RCNN을 제안한다.
  • 학습 안정화와 수렴 가속화를 위해 식별 매핑을 통한 단순 연결(shortcut connections)을 적용하여 잔차 학습을 적용한다.
  • 사전 분할된 데이터가 필요 없이 엔드 투 엔드 학습을 위해 연결주의적 시간 분류(CTC)를 사용한다.
  • 음소 시퀀스를 디코딩하고 보정하기 위해 전체 학습 세트에서 훈련된 이중 통계적 n-그램 언어 모델을 활용한다.
  • 배치 정규화와 ReLU 활성화 함수를 사용한 미니배치 확률적 경사 하강법으로 모델을 훈련한다.
  • 다양한 변종을 비교한다: CR1–CR4(표준 CRNN), RC1–RC6(제안된 RCNN), Res-RC2/Res-CR2(잔차 버전).

실험 결과

연구 질문

  • RQ1순환층을 합성곱층 이전에 두는 네트워크 아키텍처 재정렬이 음성 인식에서 수렴 속도와 인식 정확도 향상에 기여하는가?
  • RQ2심층 잔차 학습이 제안된 순환 합성곱 신경망 아키텍처에서 수렴 속도 향상과 성능 향상에 뚜렷한 영향을 미치는가?
  • RQ3제안된 RCNN 아키텍처는 표준 CRNN에 비해 음소 오류율과 학습 효율성 측면에서 어떻게 비교되는가?
  • RQ4심층 CRNN에 잔차 블록을 적용할 경우 성능 열화가 발생하는 원인은 무엇이며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • 제안된 RC2 모델은 테스트 음소 오류율(PER) 20.71%를 기록하여 기존의 깊은 신뢰 네트워크와 경쟁 가능한 성능을 보였다.
  • CR2 모델은 PER 18.73%를 기록하여 RC2를 능가했지만, 더 긴 학습 시간이 소요되었다.
  • Res-RC2 모델은 가장 빠른 수렴 속도를 기록하며 테스트 PER 17.33%를 달성하여, 새로운 아키텍처에서 잔차 학습의 효과를 입증했다.
  • Res-CR2 모델은 CR2에 비해 약간의 향상(18.90% PER)을 보였지만, 잔차 블록의 깊이가 성능 향상에 제한을 주었을 가능성이 있다.
  • RCNN 아키텍처는 첫 번째 반의 학습 동안 표준 CRNN보다 더 빠른 수렴을 보이며 최적화 역학 향상을 시사한다.
  • Res-CR2에서 관찰된 성능 열화는 잔차 블록의 극도로 깊은 깊이와 상단 순환층이 수렴에 미치는 영향 때문으로 추정된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.