Skip to main content
QUICK REVIEW

[논문 리뷰] Graph based manifold regularized deep neural networks for automatic speech recognition

Vikrant Singh Tomar, Richard C. Rose|arXiv (Cornell University)|2016. 06. 19.
Speech Recognition and Synthesis참고 문헌 24인용 수 4
한 줄 요약

이 논문은 학습 중 음성 특징 공간에서 국소적 이웃 관계를 유지함으로써 음성 인식의 정확도를 향상시키기 위해 다양체 정규화 딥 네ural 네트워크(MRDNNs)를 제안한다. DNN 최적화 기준에 그래프 기반의 다양체 제약 조건을 통합함으로써, MRDNNs는 Aurora-2 데이터셋에서 최대 37%의 상대적 단어 오류율(WER) 감소와 Aurora-4에서 최대 14.43%의 감소를 달성하여, 은닉층에서의 강건성과 특징의 밀도 향상을 입증한다.

ABSTRACT

Deep neural networks (DNNs) have been successfully applied to a wide variety of acoustic modeling tasks in recent years. These include the applications of DNNs either in a discriminative feature extraction or in a hybrid acoustic modeling scenario. Despite the rapid progress in this area, a number of challenges remain in training DNNs. This paper presents an effective way of training DNNs using a manifold learning based regularization framework. In this framework, the parameters of the network are optimized to preserve underlying manifold based relationships between speech feature vectors while minimizing a measure of loss between network outputs and targets. This is achieved by incorporating manifold based locality constraints in the objective criterion of DNNs. Empirical evidence is provided to demonstrate that training a network with manifold constraints preserves structural compactness in the hidden layers of the network. Manifold regularization is applied to train bottleneck DNNs for feature extraction in hidden Markov model (HMM) based speech recognition. The experiments in this work are conducted on the Aurora-2 spoken digits and the Aurora-4 read news large vocabulary continuous speech recognition tasks. The performance is measured in terms of word error rate (WER) on these tasks. It is shown that the manifold regularized DNNs result in up to 37% reduction in WER relative to standard DNNs.

연구 동기 및 목표

  • 음성 인식을 위한 DNN 기반 음성 모델링에서의 과적합 및 일반화 부족 문제를 해결하기 위해.
  • 음성 특징 공간에서 국소적 이웃 관계를 유지함으로써 특징 표현 학습을 향상시키기 위해.
  • 사전 훈련에 의존하지 않고도 훈련의 강건성을 향상시키는 정규화 프레임워크를 개발하기 위해.
  • 노이즈가 있는 및 청소된 음성 인식 환경에서 다양체 정규화가 WER에 미치는 영향을 평가하기 위해.
  • 초기 훈련 에포크 동안만 다양체 제약 조건을 적용할 경우의 계산 및 성능 트레이드오프를 조사하기 위해.

제안 방법

  • 음성 특징 벡터에서 구성된 그래프를 기반으로 다양체 정규화 항을 정의하여 국소적 이웃 관계를 인코딩한다.
  • 표준 DNN 손실과 은닉층 표현에서 국소 구조 유지에 대한 페널티를 부여하는 다양체 정규화 항을 조합한 목적 함수를 구성한다.
  • 다양체 구조를 모델링하기 위해 그래프 라플라시안을 사용하며, 이는 입력 공간에서 가까운 점들이 은닉 표현 공간에서도 가까이 유지되도록 정규화 항을 강제한다.
  • GMM-HMM 음성 인식 시스템에서 분류적 특징 추출을 위한 병렬 DNN와 버블넥 레이어에 이 방법을 적용한다.
  • 수정된 목적 함수를 사용한 오차 역전파를 통해 훈련을 수행하며, 수축 비율을 특징 매핑에서 국소성 유지 정도를 정량화하는 데 사용한다.
  • 제거 실험을 통해 첫 10 에포크 동안만 다양체 제약 조건을 적용한 후 기존의 역전파 방식으로 훈련을 수행한다.

실험 결과

연구 질문

  • RQ1다양체 정규화가 국소 데이터 구조를 유지함으로써 DNN의 일반화 능력을 음성 인식에서 향상시킬 수 있는가?
  • RQ2다양체 정규화는 노이즈가 있는 및 청소된 음성 인식 작업에서 단어 오류율(WER)을 어느 정도 감소시키는가?
  • RQ3초기 훈련 에포크 동안만 다양체 제약 조건을 적용할 경우, 전체 훈련에 정규화를 적용한 것과 유사한 성능을 달성할 수 있는가?
  • RQ4다양체 정규화는 역전파 중 기울기 추정의 강건성에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 사전 훈련이나 복잡한 아키텍처 없이도 은닉층에서의 특징 밀도 향상을 가능하게 하는가?

주요 결과

  • MRDNNs는 표준 DNNs 대비 Aurora-2 연결된 숫자 인식 작업에서 최대 37%의 상대적 WER 감소를 달성했다.
  • Aurora-4 대용량 연속 음성 인식 작업에서, MRDNNs는 청소된 훈련 데이터에서는 최대 14.43%의 WER 감소를, 혼합 노이즈 훈련에서는 10%의 감소를 기록했다.
  • 초기 10 에포크 동안만 다양체 정규화를 적용하는 MRDNN_10 버전은 청소된 Aurora-2에서 WER 0.39%를 기록했으며, 이는 표준 DNNs 대비 31.5%의 상대적 향상이다.
  • 수축 비율 분석을 통해 MRDNNs가 은닉층 표현에서 음성 특징 벡터 간의 국소적 이웃 관계를 유지함을 확인했다.
  • 다양체 정규화는 역전파 중 기울기 추정의 강건성을 향상시켜 훈련 안정성 향상을 시사했다.
  • 이 방법은 다양한 노이즈 조건과 데이터셋에서 일관된 성능 향상을 보이며 강건한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.