Skip to main content
QUICK REVIEW

[논문 리뷰] A comprehensive study of batch construction strategies for recurrent neural networks in MXNet

Patrick Doetsch, Pavel Golik|arXiv (Cornell University)|2017. 05. 05.
Speech Recognition and Synthesis참고 문헌 10인용 수 5
한 줄 요약

이 논문은 순환 신경망 훈련에서 배치 구성에 대한 교대 정렬 전략을 제안한다. 여기서 셔플된 시퀀스는 교대로 정렬된 순서로 분할되어 영어 패딩을 줄이고 훈련 효율을 향상시킨다. CHiME-4 ASR 작업에서 평가한 결과, 이 방법은 무작위 셔플링과 유사한 인식 성능(WER ~8.9%)을 달성하면서도 정렬된 배치 처리 수준의 속도를 유지하여 MXNet의 버킷링 방법보다 더 단순하고 효과적인 대안을 제공한다.

ABSTRACT

In this work we compare different batch construction methods for mini-batch training of recurrent neural networks. While popular implementations like TensorFlow and MXNet suggest a bucketing approach to improve the parallelization capabilities of the recurrent training process, we propose a simple ordering strategy that arranges the training sequences in a stochastic alternatingly sorted way. We compare our method to sequence bucketing as well as various other batch construction strategies on the CHiME-4 noisy speech recognition corpus. The experiments show that our alternated sorting approach is able to compete both in training time and recognition performance while being conceptually simpler to implement.

연구 동기 및 목표

  • 변동 길이 시퀀스로 인한 영어 패딩의 비효율성 문제를 해결하기 위해.
  • 패딩 프레임으로 인한 계산 낭비를 줄여 훈련 속도와 인식 성능을 향상시키기 위해.
  • MXNet에서 기존의 버킷링 방법보다 더 단순하고 직관적인 배치 구성 전략을 제안하기 위해.
  • 배치 구성 전략이 훈련 시간과 ASR 시스템 성능에 미치는 영향을 평가하기 위해.
  • 스토캐스틱한 교대 정렬 전략이 속도와 정확성 측면에서 표준 버킷링을 능가할 수 있는지 보여주기 위해.

제안 방법

  • 시퀀스는 먼저 길이 순서에 따른 편향을 제거하기 위해 무작위로 셔플된다.
  • 셔플된 시퀀스는 고정 크기의 세그먼트로 분할된다.
  • 전체 훈련 세트에 걸쳐 각 세그먼트는 교대로 정렬된다—홀수 세그먼트는 증가 순서, 짝수 세그먼트는 감소 순서로 정렬된다.
  • 이 방법은 내부 배치 내 길이 변동성을 줄이면서도 외부 배치 간 다양성을 유지한다.
  • 각 세그먼트 내에서 유사한 길이의 시퀀스를 그룹화하여 영어 패딩을 최소화한다.
  • 이 방법은 MXNet에 구현되어 무작위 셔플링, 정렬된 배치 처리 및 MXNet의 내장 버킷링 전략과 비교된다.

실험 결과

연구 질문

  • RQ1RNN 기반 ASR에서 배치 구성 전략은 훈련 시간과 인식 성능에 어떤 영향을 미치는가?
  • RQ2더 단순한 배치 구성 방법이 MXNet의 표준 버킷링 방법을 능가할 수 있는가?
  • RQ3셔플된 시퀀스 세그먼트의 교대 정렬이 영어 패딩을 줄이고 훈련 효율을 향상시키는가?
  • RQ4다양한 배치 구성 전략 간 훈련 속도와 ASR 정확성 간의 트레이드오프는 어떠한가?
  • RQ5내부 배치 내 길이 변동성이 모델 수렴과 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 교대 정렬 방법은 10.0 utterances per second로 WER 9.5%를 달성하였으며, 이는 무작위 셔플링(WER ~8.9%, ~7.0 utt/sec)과 유사한 성능을 보였다.
  • 정렬된 배치 처리는 가장 빠른 훈련 속도(10.2 utt/sec)를 기록했지만 가장 열악한 인식 성능(WER 10.2%)을 보였으며, 이는 고정 길이 순서의 강한 부정적 영향을 시사한다.
  • MXNet의 버킷링 방법은 제안된 방법보다 더 높은 메모리 소비(6.3 GB)와 느린 훈련(9.5 utt/sec)을 보였으며, 제안된 방법은 4.8–6.0 GB의 메모리 사용과 8.8–10.1 utt/sec의 훈련 속도를 기록했다. 이는 백업 수에 따라 달라졌다.
  • 256개의 백업을 사용한 제안된 방법은 WER 9.1%를 달성하여 MXNet의 버킷링(9.6%)을 초월했으며, 무작위 셔플링 성능에 가까워졌다.
  • 교대 정렬 전략은 버킷링과 정렬된 배치 처리 모두보다 훈련 속도와 인식 정확성 간의 균형을 더 잘 달성했다.
  • 이 방법은 백업 크기와 분포를 조정할 필요가 없기 때문에 버킷링보다 더 간단하게 구현하고 파arameterize할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.