Skip to main content
QUICK REVIEW

[논문 리뷰] Very Deep Multilingual Convolutional Neural Networks for LVCSR

Tom Sercu, Christian Puhrsch|arXiv (Cornell University)|2015. 09. 29.
Speech Recognition and Synthesis참고 문헌 27인용 수 6
한 줄 요약

이 논문은 매우 깊은 다국어 컨볼루션 신경망(CNN)을 제안하여 대용량 연속 음성 인식(LVCSR)을 위해 사용한다. VGG를 영감으로 받은 아키텍처를 사용하며, 14개의 가중치 레이어, 작은 3×3 커널, 풀링 레이어당 다수의 컨볼루션 레이어를 포함한다. Hub5'00에서 1.4%p의 절대 WER 향상(10.6% 상대적 향상)을 달성하여 WER 11.8%를 기록했고, 6개 언어를 함께 훈련시켜 저자원 Babel 작업에서 5.77% WER 향상을 이룬다.

ABSTRACT

Convolutional neural networks (CNNs) are a standard component of many current state-of-the-art Large Vocabulary Continuous Speech Recognition (LVCSR) systems. However, CNNs in LVCSR have not kept pace with recent advances in other domains where deeper neural networks provide superior performance. In this paper we propose a number of architectural advances in CNNs for LVCSR. First, we introduce a very deep convolutional network architecture with up to 14 weight layers. There are multiple convolutional layers before each pooling layer, with small 3x3 kernels, inspired by the VGG Imagenet 2014 architecture. Then, we introduce multilingual CNNs with multiple untied layers. Finally, we introduce multi-scale input features aimed at exploiting more context at negligible computational cost. We evaluate the improvements first on a Babel task for low resource speech recognition, obtaining an absolute 5.77% WER improvement over the baseline PLP DNN by training our CNN on the combined data of six different languages. We then evaluate the very deep CNNs on the Hub5'00 benchmark (using the 262 hours of SWB-1 training data) achieving a word error rate of 11.8% after cross-entropy training, a 1.4% WER improvement (10.6% relative) over the best published CNN result so far.

연구 동기 및 목표

  • 깊은 네트워크가 아직 널리 채택되지 않은 대용량 연속 음성 인식(LVCSR) 분야에, VGG ImageNet 2014 모델을 영감으로 삼은 매우 깊은 CNN 아키텍처를 적용하는 것.
  • 6개 언어의 데이터를 통합하여 다국어 CNN을 훈련시켜 언어 간 공유되는 음성 표현을 활용함으로써 저자원 음성 인식 성능을 향상시키는 것.
  • 소비하는 계산 비용이 거의 없는 조건에서, 더 많은 음성적 맥락을 활용할 수 있도록 다중 스케일 입력 특징을 통해 맥락 모델링을 향상시키는 것.
  • 표준 벤치마크인 Hub5'00과 저자원 Babel 작업에서 제안된 깊은 CNN 아키텍처의 성능을 평가하여, 이전의 CNN 기반 및 DNN 기반 시스템에 비해 성능 향상을 입증하는 것.

제안 방법

  • 풀링 레이어 이전에 스택된 3×3 컨볼루션 커널을 사용하는 VGG 스타일 아키텍처를 채택하며, 깊이를 14개의 가중치 레이어(10개의 컨볼루션, 4개의 완전 연결)로 증가시켜 큰 커널과 시그모이드 활성화 함수를 작은 커널과 ReLU 비선형성으로 대체한다.
  • 언어별 특징 학습이 가능하도록 언어별로 다른 가중치를 허용하는 untied 레이어를 도입함으로써, 더 깊은 표현을 공유함으로써 저자원 환경에서 일반화 성능을 향상시킨다.
  • 다양한 시간 해상도의 입력 스펙트로그램을 조합하여 다중 스케일 입력 특징을 활용함으로써, 네트워크가 국소적 맥락과 넓은 맥락을 효율적으로 포착할 수 있도록 한다.
  • 딥 네트워크 훈련을 위해 적응형 최적화 알고리즘(Adadelta 및 Adam)을 사용하며, 이중 단계 전략을 적용한다: 초기 훈련 단계에서 적응형 방법을 사용하고, 이후에 SGD 미세조정을 수행함으로써 수렴성과 성능을 향상시킨다.
  • Hub5'00 실험에서는 발화자별 VTLN과 델타/더블 델타 특징을 적용하고, 클래스 불균형을 보완하기 위해 데이터 균형 요소 γ=0.8을 사용한다.
  • 교차 엔트로피 목적 함수를 사용하여 모델을 훈련하고, 표준 벤치마크인 Hub5'00 SWB와 Babel 저자원 작업에서 평가하며, 고전적인 CNN 및 DNN 베이스라인과 비교한다.

실험 결과

연구 질문

  • RQ1작은 3×3 커널과 풀링 레이어당 다수의 컨볼루션을 갖춘 매우 깊은 CNN 아키텍처가 얕은 고전적 CNN에 비해 LVCSR 성능 향상에 기여하는가?
  • RQ2언어별로 다른 가중치를 갖는 다국어 훈련이 저자원 음성 인식 작업에서 성능 향상에 얼마나 효과적인가?
  • RQ3다중 스케일 입력 특징은 계산 비용을 거의 증가시키지 않으면서 LVCSR의 음성 모델링 성능을 향상시킬 수 있는가?
  • RQ4Adadelta/Adam과 같은 적응형 최적화 방법으로 훈련한 매우 깊은 CNN 아키텍처에 이어서 SGD 미세조정을 수행하는 것이, 표준 훈련 전략에 비해 얼마나 뛰어난 성능을 내는가?
  • RQ5제안된 깊은 다국어 CNN은 이전 최고 성능의 CNN 및 DNN 시스템에 비해 표준 벤치마크인 Hub5'00과 저자원 Babel 작업에서 얼마나 높은 성능 향상을 기록하는가?

주요 결과

  • 제안된 매우 깊은 CNN(14개의 가중치 레이어)은 교차 엔트로피 훈련 후 Hub5'00 SWB 벤치마크에서 11.8% WER를 달성하였으며, 당시까지 발표된 최고의 CNN 결과보다 1.4%p 절대 WER 향상(10.6% 상대적 향상)을 기록하였다.
  • Babel 저자원 작업에서는 6개 언어의 데이터를 함께 훈련시킨 다국어 CNN을 통해 기준 PLP DNN 대비 WER을 5.77%p 절대적으로 감소시켰으며, 저자원 환경에서의 성능 향상이 뚜렷하게 입증되었다.
  • Adadelta로 훈련한 후 SGD 미세조정을 수행한 모델는 Hub5'00 훈련 세트(9210만 프레임, 총 1.4억 프레임)를 1.5회만 순회한 후 12.2% WER에 도달하여, 적절한 최적화 전략을 통해 매우 빠른 수렴을 보였다.
  • 오직 SGD로만 초기 훈련을 수행한 모델는 데이터를 3.5회 순회한 후 최고 성능인 11.8% WER를 기록하였으며, 더 긴 훈련 시간이 소요되더라도 전체 SGD 훈련이 더 뛰어난 성능을 내는 것으로 나타났다.
  • 다중 스케일 특징의 사용은 계산 비용을 크게 증가시키지 않으면서도 맥락 모델링 성능을 향상시켜, 저자원 및 표준 벤치마크 양쪽에서 성능 향상에 기여하였다.
  • 결과적으로, ImageNet 성공 사례에서 영감을 얻은 더 깊은 CNN 아키텍처는 LVCSR에서 매우 효과적이며, 다국어 사전 훈련과 다중 스케일 입력 처리를 통해 추가로 향상시킬 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.