Skip to main content
QUICK REVIEW

[논문 리뷰] Very Deep Convolutional Networks for End-to-End Speech Recognition

Yu Zhang, William Chan|arXiv (Cornell University)|2016. 10. 10.
Speech Recognition and Synthesis참고 문헌 19인용 수 10
한 줄 요약

이 논문은 잔차 연결, 배치 정규화, 네트워크 인 네트워크(NiN) 모듈, 그리고 합성곱 LSTM을 갖춘 매우 깊은 합성곱 신경망(CNN)을 제안하여 엔드 투 엔드 음성 인식 성능을 크게 향상시킨다. 양방향 LSTM 이전에 15개의 깊은 CNN 레이어와 잔차 블록을 스택함으로써, 언어 모델이나 어휘 사전 없이도 WSJ 테스트 세트에서 10.53%의 단어 오류율(WER)을 달성하였으며, 이는 기준 모델 대비 24.7% 상대적 향상이다.

ABSTRACT

Sequence-to-sequence models have shown success in end-to-end speech recognition. However these models have only used shallow acoustic encoder networks. In our work, we successively train very deep convolutional networks to add more expressive power and better generalization for end-to-end ASR models. We apply network-in-network principles, batch normalization, residual connections and convolutional LSTMs to build very deep recurrent and convolutional structures. Our models exploit the spectral structure in the feature space and add computational depth without overfitting issues. We experiment with the WSJ ASR task and achieve 10.5\% word error rate without any dictionary or language using a 15 layer deep network.

연구 동기 및 목표

  • 얕은 RNN을 초월하여 음성 인코더의 깊이와 표현력을 높임으로써 엔드 투 엔드 자동 음성 인식(ASR)을 향상시키는 것.
  • 잔차 연결, 배치 정규화, NiN과 같은 컴퓨터 비전 분야의 딥러닝 기법을 음성 인식에 적용하여 더 나은 일반화와 최적화를 달성하는 것.
  • 합성곱 LSTM이 시퀀스-투-시퀀스 모델에서 스펙트럼 구조를 유지하고 과적합을 줄이는 데 얼마나 효과적인지 탐색하는 것.
  • 언어 모델이나 어휘 사전 없이도 WSJ ASR 벤치마크에서 최고 성능을 달성하는 것.

제안 방법

  • 모델은 어텐션 기반 디코더와 깊은 CNN 기반 인코더를 갖춘 시퀀스-투-시퀀스 아키텍처를 사용한다.
  • 인코더는 시간 차원을 줄이고 GPU 메모리 사용량을 줄이기 위해 초기 레이어에서 스트라이드 컨벌루션을 사용한다.
  • 1×1 컨벌루션을 사용하여 깊이를 증가시키고 비선형성을 강화하면서 파라미터 수를 줄이는 네트워크 인 네트워크(NiN) 모듈을 적용한다.
  • 배치 정규화는 훈련을 안정화시키고 정규화 역할을 하며, 특히 기울기 분산이 높은 깊은 모델에 매우 중요하다.
  • 잔차 연결을 통해 매우 깊은 네트워크(최대 15층)를 훈련시킬 수 있으며, 성능 저하나 최적화 문제 없이 가능하다.
  • 합성곱 LSTM은 표준 LSTM을 대체하여 셀 상태에서 컨벌루션을 사용함으로써 스펙트럼 구조를 유지하고 과적합을 줄인다.

실험 결과

연구 질문

  • RQ1잔차 연결과 배치 정규화를 갖춘 매우 깊은 합성곱 네트워크가 엔드 투 엔드 음성 인식 성능을 향상시킬 수 있는가?
  • RQ2NiN 모듈과 1×1 컨벌루션은 ASR에서 더 깊고 파라미터 효율적인 모델을 만드는 데 어떻게 기여하는가?
  • RQ3표준 LSTM을 합성곱 LSTM으로 대체함으로써 음성의 스펙트럼-시간 특징을 더 잘 모델링할 수 있는가?
  • RQ4아키텍처의 깊이와 구성 요소 통합(예: 잔차 블록, 배치 정규화)이 엔드 투 엔드 ASR의 WER에 어떤 영향을 미치는가?

주요 결과

  • 제안된 모델은 언어 모델이나 어휘 사전 없이도 WSJ eval92 세트에서 10.53%의 단어 오류율(WER)을 달성하였으며, 이는 기준 seq2seq 모델에 비해 뚜렷한 향상이다.
  • 두 번째 초기 컨벌루션 레이어 이후 8개의 잔차 블록을 추가하면 WER가 11.11%로 감소하여 기준 모델 대비 24.7% 상대적 향상이 이루어졌다.
  • 잔차 블록 내에서 표준 LSTM을 합성곱 LSTM으로 대체함으로써 추가로 7% 상대적 WER 감소가 발생하여 최종적으로 10.53%에 도달했다.
  • 15층(8개의 잔차 블록과 NiN 모듈 포함)의 모델은 이전 최고 성능 모델들(동일 벤치마크에서 18.0% WER 기록)을 초월하여 성능을 뛰어넘었다.
  • 배치 정규화는 깊은 모델 훈련에 필수적이었으며, 기울기 분산이 큰 어텐션 기반 기울기에서의 발산을 방지하고 훈련을 안정화시켰다.
  • 합성곱 LSTM에서 3×1 필터의 사용은 시간 동적 특성을 효과적으로 포착하면서도 은닉 상태의 스펙트럼 구조를 유지하는 데 효과적이라는 것이 밝혀졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.