Skip to main content
QUICK REVIEW

[논문 리뷰] Frame Stacking and Retaining for Recurrent Neural Network Acoustic Model

Xu Tian, Jun Zhang|arXiv (Cornell University)|2017. 05. 17.
Speech Recognition and Synthesis참고 문헌 9인용 수 4
한 줄 요약

이 논문은 기존의 WFST 기반 디코더와의 호환성을 유지하면서 기존 단방향 LSTM 음성 모델에서 효율적인 프레임 스택킹을 가능하게 하는 디코딩 시점 기법인 '프레임 유지(frame retaining)'을 제안한다. N개의 프레임을 슈퍼프레임으로 통합하고, 그 출력을 N개의 프레임 동안 유지함으로써, 거의 선형적인 학습 속도 향상과 성능 저하 없이 실시간 요소(Real-Time Factor)를 41% 감소시킨다. 이는 중국어 말하기 데이터에서 문자 오류율(CER)을 약간 향상시킨다.

ABSTRACT

Frame stacking is broadly applied in end-to-end neural network training like connectionist temporal classification (CTC), and it leads to more accurate models and faster decoding. However, it is not well-suited to conventional neural network based on context-dependent state acoustic model, if the decoder is unchanged. In this paper, we propose a novel frame retaining method which is applied in decoding. The system which combined frame retaining with frame stacking could reduces the time consumption of both training and decoding. Long short-term memory (LSTM) recurrent neural networks (RNNs) using it achieve almost linear training speedup and reduces relative 41\% real time factor (RTF). At the same time, recognition performance is no degradation or improves sightly on Shenma voice search dataset in Mandarin.

연구 동기 및 목표

  • 기존 RNN 디코더가 그대로 유지된 상태에서, 프레임 스택킹과의 호환성 문제를 해결함으로써 인식 성능 저하를 방지하고자 한다.
  • CTC가 아닌 RNN 음성 모델에 프레임 스택킹을 적용할 수 있도록 하되, 디코더 재학습이나 HMM 구조 수정 없이 가능하게 하고자 한다.
  • 학습 및 디코딩 속도를 크게 향상시키면서도 인식 정확도를 유지하거나 약간 향상시키고자 한다.
  • 비밀번호 기반의 대규모 중국어 음성 인식 데이터셋을 사용하여, 단방향 LSTM 모델을 기반으로 한 방법의 유효성을 검증하고자 한다.

제안 방법

  • 프레임 스택킹은 N개의 연속된 음성 프레임을 하나의 슈퍼프레임으로 통합하여 입력 시퀀스 길이를 N분의의 1로 줄인다.
  • 프레임 유지 기법은 디코딩 중 슈퍼프레임의 출력을 원래 N개의 프레임 동안 반복하여 복제함으로써, 정확한 프레임 수준의 정렬을 유지한다.
  • 입력 특징 수가 출력 프레임 수와 일치하도록 하여 원래의 WFST 기반 디코더를 그대로 유지한다.
  • 음성 모델은 미니배치 SGD와 모멘타임을 사용한 교차 엔트로피 손실로 학습하고, 대규모 중국어 데이터셋에서 sMBR 학습을 추가로 수행한다.
  • 분산 학습을 효율적으로 수행하기 위해 블록 단위 모델 업데이트 필터링(BMUF)과 지수이동평균(EMA)을 적용한 MPI 기반 분산 HPC 시스템을 사용한다.
  • 입력으로는 26차원 필터뱅크 특징, 2차원 피치 및 그의 일阶와 이阶 미분 특징을 사용하며, 출력 클래스로는 11,088개의 연결된 상태(tied-states)를 사용한다.

실험 결과

연구 질문

  • RQ1기존의 비-CTC RNN 음성 모델에 프레임 스택킹을 효과적으로 적용할 수 있는가? 성능 저하 없이 가능할까?
  • RQ2표준 WFST 기반 디코딩 시스템에서 프레임 스택킹이 디코딩 속도와 실시간 요소(RTF)에 어떤 영향을 미치는가?
  • RQ3입력 프레임 수가 감소하는 프레임 스택킹 상황에서, 디코딩 단계에서의 프레임 유지 기법이 정렬 일관성을 어떻게 복구하는가?
  • RQ4프레임 스택킹과 프레임 유지 기법을 결합했을 때 인식 정확도나 속도가 향상되는가? 최적의 스택킹 및 유지 요소 조합은 무엇인가?

주요 결과

  • 표준 디코더를 사용할 경우, 프레임 스택킹만 적용하면 문자 오류율(CER)이 415% 증가하여, 모델링 지속시간 불일치로 인한 심각한 성능 저하가 발생함을 확인하였다.
  • 스택킹 요소(FS=3)와 유지 요소(FR=3)를 결합한 경우, CER는 3.81%로 기준값(3.89%)보다 약간 향상되어 일관된 성능 향상을 보였다.
  • FS와 FR 모두 3으로 설정했을 때, 실시간 요소(RTF)가 기준값 대비 41% 감소하여 가장 빠른 디코딩 속도를 달성하였다.
  • 최적의 구성은 FS=3 및 FR=3이며, 이는 속도와 정확도 사이의 최적의 균형을 이룬다. RTF는 0.41에서 0.24로 감소하였다.
  • 입력 시퀀스 길이 감소로 인해 거의 선형적인 학습 속도 향상이 가능했으며, 동시에 기존의 WFST 디코딩 인프라와의 호환성도 유지되었다.
  • 대규모 중국어 음성 인식에서 효과적이었으며, 어휘 크기 760,000, 5-gram 언어 모델을 사용하고, BMUF와 EMA를 활용한 8-GPU 분산 학습 환경에서 성능을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.