Skip to main content
QUICK REVIEW

[논문 리뷰] Exponential Moving Average Model in Parallel Speech Recognition Training

Xu Tian, Jun Zhang|arXiv (Cornell University)|2017. 03. 03.
Natural Language Processing Techniques참고 문헌 12인용 수 3
한 줄 요약

이 논문은 다중 GPU 클러스터를 사용한 대규모 병렬 음성 인식 학습을 위한 비간섭성 지수이동평균(EMA) 방법을 제안한다. 동기 학습 중에 워커에 브로드캐스트하지 않고도 EMA 모델을 유지함으로써, 표준 모델 평균화보다 우수한 성능을 달성한다. DNN에서 기준 BMUF 대비 3.9% 향상되고 단일 GPU 학습 대비 8.4% 향상된 중국어 음성 인식 문자오류율(CER)을 기록하며, 근사 선형 속도 향상과 더불어 안정성 향상을 이룬다.

ABSTRACT

As training data rapid growth, large-scale parallel training with multi-GPUs cluster is widely applied in the neural network model learning currently.We present a new approach that applies exponential moving average method in large-scale parallel training of neural network model. It is a non-interference strategy that the exponential moving average model is not broadcasted to distributed workers to update their local models after model synchronization in the training process, and it is implemented as the final model of the training system. Fully-connected feed-forward neural networks (DNNs) and deep unidirectional Long short-term memory (LSTM) recurrent neural networks (RNNs) are successfully trained with proposed method for large vocabulary continuous speech recognition on Shenma voice search data in Mandarin. The character error rate (CER) of Mandarin speech recognition further degrades than state-of-the-art approaches of parallel training.

연구 동기 및 목표

  • 깊이 신경망을 위한 음성 인식에서 대규모 병렬 학습 시 더 느린 수렴과 성능 저하 문제를 해결하기 위해.
  • 통신 오버헤드를 증가시키지 않고도 다중 GPU 분산 학습에서 모델 일반화 및 테스트 정확도를 향상시키기 위해.
  • 동기적이고 분산된 병렬 학습에서 지수이동평균(EMA)이 최종 모델 추정기로서의 효과를 탐색하기 위해.
  • 대규모 어휘 연속 음성 인식(LVCSR)에서 모델 평균화 및 기준 BMUF 방법보다 더 우수한 성능을 달성하기 위해.

제안 방법

  • 동기적 다중 GPU 학습 중에 전역 모델 추정치를 유지하기 위해 지수이동평균(EMA)을 적용하며, 파라미터 서버에서만 업데이트하고 워커에 브로드캐스트하지 않는다.
  • 표준 EMA 업데이트 규칙을 사용: $ \bar{\theta}_{t} = \alpha \bar{\theta}_{t-1} + (1 - \alpha) \theta_t $, 여기서 $ \theta_t $ 는 단계 $ t $ 에서 동기화된 모델이다.
  • 중앙 집중식 파라미터 서버의 병목 현상을 방지하고 GPU 활용도를 극대화하기 위해 8개 GPU 간 페어 투 페어 통신 방식을 구현한다.
  • 시간적 맥락을 유지하면서 계산량과 학습 시간을 줄이기 위해 3프레임 프레임 스택킹을 활용한다.
  • 로컬 워커 업데이트를 수정하지 않고도 EMA를 최종 모델로 사용하여 Shenma 중국어 음성 검색 데이터에서 DNN 및 단방향 LSTM 모델을 학습한다.
  • 성능 평가에 검증 세트의 FER과 테스트 세트의 CER를 사용하며, 디코딩 결과 기반으로 EMA를 최종 모델로 선택한다.

실험 결과

연구 질문

  • RQ1EMA는 워커 업데이트에 간섭 없이 대규모 병렬 음성 인식 학습에서 일반화 및 테스트 정확도를 향상시킬 수 있는가?
  • RQ2LVCSR에서 수렴 안정성과 최종 CER 측면에서 EMA는 모델 평균화 및 BMUF와 비교해 어떻게 성능을 내는가?
  • RQ3EMA는 DNN 및 LSTM과 같은 다양한 아키텍처에서 중국어 음성 인식에서 일관된 성능 향상을 제공하는가?
  • RQ4EMA는 단일 GPU 학습 대비 모델 정확도를 유지하거나 향상시키면서 근사 선형 속도 향상을 달성할 수 있는가?

주요 결과

  • EMA 방법은 LSTM 모델에서 기준 BMUF 대비 테스트 세트에서 상대적으로 3.9% 향상된 문자오류율(CER)을 기록했다.
  • 8층 DNN에서는 기준 대비 EMA 방법이 CER을 8.4% 상대적으로 감소시켜 더 깊은 아키텍처에서 강력한 성능 향상을 보였다.
  • EMA는 최종 CER 측면에서 BMUF 및 모델 평균화(MA)를 모두 압도했으며, MA는 가끔 BMUF를 초과하는 불안정한 성능을 보였다.
  • 모든 에포크 동안 EMA 모델은 MA보다 항상 낮은 CER을 기록하여 모델 선택의 더 높은 안정성과 신뢰성을 보였다.
  • 프레임 스택킹은 계산량과 학습 시간을 크게 줄였으며, 최소한의 오버헤드로 효율적인 대규모 학습을 가능하게 했다.
  • 페어 투 페어 통신을 활용한 분산 학습 설정은 GPU 활용도를 극대화하고 동기화 중 대기 시간을 방지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.