[논문 리뷰] A novel pyramidal-FSMN architecture with lattice-free MMI for speech recognition
이 논문은 계층적 메모리 구조를 계층 간에 통합하고, 특징 추출을 향상시키기 위해 res-CNN을 통합한 새로운 피라미드형 FSMN 아키텍처를 제안한다. 라티스-프리 MMI와 CE의 공동 학습과 결합하여, Librispeech에서 3.62%의 WER을 달성하고, RNNLM 재평가를 통해 2.97%까지 저하되며, 이는 당시 기준 최고 성능을 보여준다.
Deep Feedforward Sequential Memory Network (DFSMN) has shown superior performance on speech recognition tasks. Based on this work, we propose a novel network architecture which introduces pyramidal memory structure to represent various context information in different layers. Additionally, res-CNN layers are added in the front to extract more sophisticated features as well. Together with lattice-free maximum mutual information (LF-MMI) and cross entropy (CE) joint training criteria, experimental results show that this approach achieves word error rates (WERs) of 3.62% and 10.89% respectively on Librispeech and LDC97S62 (Switchboard 300 hours) corpora. Furthermore, Recurrent neural network language model (RNNLM) rescoring is applied and a WER of 2.97% is obtained on Librispeech.
연구 동기 및 목표
- 깊이 있는 신경망에서의 맥락 모델링 향상을 통해 음성 인식 성능을 향상시키기 위해.
- 기본 FSMN이 다중 척도 시간적 의존성을 포착하는 데에 한계가 있음을 해결하기 위해.
- 더 풍부한 특징 표현을 위해 잔차 합성곱층을 통합하기 위해.
- 강제 정렬 없이도 음향 모델을 최적화하기 위해 라티스-프리 MMI 학습을 활용하기 위해.
- Librispeech 및 Switchboard 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- 장기적 의존성을 계층적으로 모델링하기 위해, 계층 간에 시간 풀링과 선형 변환을 적용하는 피라미드형 메모리 구조를 제안한다.
- 원시 입력에서 계층적이고 특징적인 특징을 추출하기 위해, 앞부분에 잔차 합성곱(res-CNN)층을 도입한다.
- 피라미드 구조를 통해 다중 수용장치 모델링이 가능한 깊이 있는 순차적 피드포워드 메모리 네트워크(DFSMN)를 백본으로 사용한다.
- 음향 모델의 일반화 성능을 향상시키기 위해, 라티스-프리 최대 상호정보량(LF-MMI)과 교차 엔트로피(CE) 기준을 공동 학습에 적용한다.
- 더 나은 가설을 도출하고 WER을 감소시키기 위해 RNNLM 재평가를 사용한다.
실험 결과
연구 질문
- RQ1계층적 메모리 구조는 FSMN 기반 음성 인식 시스템의 맥락 모델링을 향상시킬 수 있는가?
- RQ2잔차 합성곱층을 추가하면 엔드 투 엔드 음성 인식에서 특징 표현이 향상되는가?
- RQ3기존 학습 방식과 비교해 LF-MMI와 CE의 공동 학습이 WER을 추가로 향상시킬 수 있는가?
- RQ4제안된 아키텍처는 Librispeech 및 Switchboard와 같은 표준 벤치마크에서 어떻게 성능을 내는가?
- RQ5RNNLM 재평가를 제안된 아키텍처와 결합했을 때, WER는 어느 정도 감소하는가?
주요 결과
- 제안된 피라미드형 FSMN은 Librispeech 테스트 세트에서 3.62%의 단어 오류율(WER)을 달성하여 이전의 FSMN 기반 모델을 능가했다.
- LDC97S62(Switchboard 300시간) 코퍼스에서 모델은 10.89%의 WER을 기록하여 강력한 일반화 능력을 보였다.
- RNNLM 재평가를 통해 Librispeech의 WER은 2.97%로 추가로 감소하였으며, 최고 수준의 성능에 가까워졌다.
- res-CNN층의 통합은 특징 추출 능력을 크게 향상시켜 모델 정확도 향상에 기여했다.
- LF-MMI와 CE의 공동 학습은 특히 자원이 적은 환경에서 모델의 강인성과 일반화 능력을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.