Skip to main content
QUICK REVIEW

[논문 리뷰] Deep-FSMN for Large Vocabulary Continuous Speech Recognition

Shiliang Zhang, Ming Lei|arXiv (Cornell University)|2018. 03. 04.
Speech Recognition and Synthesis인용 수 13
한 줄 요약

이 논문은 깊은 아키텍처에서 기울기 소실 문제를 완화하기 위해 계층 간 스킵 연결을 통합한 향상된 피드포워드 순차 메모리 네트워크인 Deep-FSMN(DFSMN)을 제안한다. 스킵 연결과 함께 저프레임레이트(LFR) 처리를 결합함으로써 DFSMN은 상당한 WER 감소를 달성한다. 영어 Fisher 데이터셋에서 BLSTM 대비 1.5%p의 절대적 개선(9.4% WER)을 기록하였고, 20,000시간 분량의 중국어 데이터셋에서 20% 이상의 상대적 개선을 이룬다. 또한 제어 가능한 앞서기 필터 순서를 통해 저지연 추론을 가능하게 한다.

ABSTRACT

In this paper, we present an improved feedforward sequential memory networks (FSMN) architecture, namely Deep-FSMN (DFSMN), by introducing skip connections between memory blocks in adjacent layers. These skip connections enable the information flow across different layers and thus alleviate the gradient vanishing problem when building very deep structure. As a result, DFSMN significantly benefits from these skip connections and deep structure. We have compared the performance of DFSMN to BLSTM both with and without lower frame rate (LFR) on several large speech recognition tasks, including English and Mandarin. Experimental results shown that DFSMN can consistently outperform BLSTM with dramatic gain, especially trained with LFR using CD-Phone as modeling units. In the 2000 hours Fisher (FSH) task, the proposed DFSMN can achieve a word error rate of 9.4% by purely using the cross-entropy criterion and decoding with a 3-gram language model, which achieves a 1.5% absolute improvement compared to the BLSTM. In a 20000 hours Mandarin recognition task, the LFR trained DFSMN can achieve more than 20% relative improvement compared to the LFR trained BLSTM. Moreover, we can easily design the lookahead filter order of the memory blocks in DFSMN to control the latency for real-time applications.

연구 동기 및 목표

  • 대규모 어휘 연속 음성 인식(LVCSR)을 위한 매우 깊은 피드포워드 순차 메모리 네트워크(FSMN)에서 기울기 소실과 학습 불안정성을 해결하기 위해.
  • 아키텍처 혁신을 통해 BLSTM과 같은 순환 모델보다 더 깊고 안정적인 아키텍처를 가능하게 하여 성능을 향상시키기 위해.
  • 메모리 블록 내에서 제어 가능한 앞서기 필터 순서를 설계하여 실시간 응용 프로그램에서 저지연 추론을 가능하게 하기 위해.
  • LFR 조건 하에서 2,000시간 분량의 영어 및 20,000시간 분량의 중국어 데이터셋을 포함한 대규모 음성 인식 작업에서 제안된 DFSMN을 평가하기 위해.

제안 방법

  • 깊은 네트워크에서 기울기 소실 문제를 완화하고 정보 흐름을 촉진하기 위해 FSMN의 인접 계층 간 메모리 블록에 스킵 연결을 도입한다.
  • 장기적인 시간적 의존성을 모델링하기 위해 후행 및 앞서기 필터 순서를 갖는 학습 가능한 FIR 유사 메모리 블록을 FSMN 아키텍처에 추가하여 변형한다.
  • 계산 비용과 디코딩 지연을 줄이면서도 정확도를 유지하기 위해 DFSMN을 저프레임레이트(LFR) 처리와 통합한다.
  • 성능 저하 없이 더 깊은 네트워크 깊이를 허용하기 위해 잔차 유사 스킵 연결을 사용한 깊은 FSMN 계층 스택을 구축한다.
  • 메모리 블록 내 앞서기 필터 순서를 설계하여 지연을 제어하고, 최소한의 성능 손실로 실시간 배포가 가능하도록 한다.
  • 다중 GPU에서 분산 최적화(BMUF)를 사용한 프레임 단위 교차 엔트로피 기준으로 모든 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1FSMN과 같은 깊은 피드포워드 아키텍처에 스킵 연결을 도입할 경우, 대규모 LVCSR 작업에서 학습 안정성과 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ2대규모 코퍼스에서 LFR로 훈련된 경우, DFSMN은 BLSTM 대비 단어 오류율(WER)에서 어떤 성능을 보이는가?
  • RQ3LCBLSTM에 비해 지연을 제어하는 것과 비교해 DFSMN은 정확도를 유지하거나 향상시키면서 얼마나 지연을 줄일 수 있는가?
  • RQ4표준 cFSMN와 달리, DFSMN의 더 깊은 아키텍처는 성능 저하 없이 일관된 성능 향상을 이끌 수 있는가?
  • RQ5동일 조건 하에서 DFSMN은 더 작은 모델 크기와 더 빠른 훈련 속도로 BLSTM에 비해 열등한 성능을 내는가?

주요 결과

  • 2,000시간 분량의 영어 Fisher(FSH) 작업에서 DFSMN은 단지 교차 엔트로피 훈련과 3-그램 언어 모델을 사용하여 9.4%의 단어 오류율(WER)을 기록하였으며, 이는 BLSTM 대비 1.5%p의 절대적 개선이다.
  • 20,000시간 분량의 중국어 음성 인식 작업에서 LFR로 훈련된 DFSMN은 더 작은 모델 크기임에도 불구하고 LFR로 훈련된 LCBLSTM 대비 20% 이상의 상대적 WER 개선을 달성한다.
  • 150ms 지연(5프레임 앞서기)을 갖는 DFSMN은 1,200ms 지연(40프레임)을 갖는 LCBLSTM를 능가하며, 지연-성능 트레이드오프 측면에서 열등한 성능을 보인다.
  • DFSMN의 훈련 속도는 LCBLSTM 대비 약 3배 빠르며, 디코딩 실시간 요소(RTF) 역시 약 3배 향상되었다.
  • cFSMN는 과도한 깊이(예: 10층)에서 성능이 저하되지만, 스킵 연결 덕분에 DFSMN은 더 깊은 아키텍처에서도 일관된 향상을 유지한다.
  • 제안된 DFSMN 아키텍처는 앞서기 필터 순서를 제어함으로써 지연을 제어할 수 있어 정확도를 희생시키지 않고 실시간 응용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.