Skip to main content
QUICK REVIEW

[논문 리뷰] INT8 Winograd Acceleration for Conv1D Equipped ASR Models Deployed on Mobile Devices

Yiwu Yao, Yuchao Li|arXiv (Cornell University)|2020. 10. 28.
Fault Detection and Control Systems참고 문헌 21인용 수 8
한 줄 요약

이 논문은 모바일 디바이스에서 Conv1D 기반 ASR 모델의 속도를 향상시키기 위해 범위 스케일링 양자화(RSQ) 학습과 저정밀도 윈오그라드 컨볼루션을 결합한 새로운 INT8 윈오그라드 양자화 파이프라인을 제안한다. 정 fine-tuning 동안 양자화 범위를 공동 최적화하고 양자화 노이즈를 최소화함으로써, 이 방법은 ARMv7 디바이스에서 최대 1.48배의 속도 향상을 달성하면서 WER가 0.07%만 증가하여 표준 INT8 GEMM 및 PTQ 방법을 뛰어넘으며 모델 정확도를 유지한다.

ABSTRACT

The intensive computation of Automatic Speech Recognition (ASR) models obstructs them from being deployed on mobile devices. In this paper, we present a novel quantized Winograd optimization pipeline, which combines the quantization and fast convolution to achieve efficient inference acceleration on mobile devices for ASR models. To avoid the information loss due to the combination of quantization and Winograd convolution, a Range-Scaled Quantization (RSQ) training method is proposed to expand the quantized numerical range and to distill knowledge from high-precision values. Moreover, an improved Conv1D equipped DFSMN (ConvDFSMN) model is designed for mobile deployment. We conduct extensive experiments on both ConvDFSMN and Wav2letter models. Results demonstrate the models can be effectively optimized with the proposed pipeline. Especially, Wav2letter achieves 1.48* speedup with an approximate 0.07% WER decrease on ARMv7-based mobile devices.

연구 동기 및 목표

  • 낮은 계산 대 메모리 액세스 비율로 인해 모바일에 배포된 Conv1D 기반 ASR 모델에서 발생하는 성능 저하 문제를 해결한다.
  • 양자화와 윈오그라드 컨볼루션을 결합할 때 정밀도 오버플로우와 정보 손실을 해결한다.
  • 양자화와 빠른 컨볼루션 기법을 통합하여 모바일 디바이스에서 효율적이고 저지연 인퍼런스를 가능하게 한다.
  • 제안된 최적화 파이프라인의 이점을 누릴 수 있는 모바일 최적화된 ASR 모델(ConvDFSMN)을 설계한다.
  • 종단 간 학습과 최적화를 통해 최고의 속도로 인퍼런스를 구현하면서 정확도 저하를 최소화한다.

제안 방법

  • 윈오그라드 변환에서 오버플로우를 방지하기 위해 양자화된 수치 범위를 확장하는 범위 스케일링 양자화(RSQ) 학습을 제안한다.
  • 저정밀도 양자화로 인한 정밀도 손실을 최소화하기 위해 미세조정 단계에서 양자화 노이즈 손실 함수를 도입한다.
  • 윈오그라드 도메인에서 표준 컨볼루션을 효율적인 하다르드 곱셈 연산으로 대체하기 위해 윈오그라드의 최소 필터링을 적용한다.
  • 윈오그라드 도메인에서 전체 정수 하다르드 곱셈을 사용하여 모바일 디바이스에서 INT8 윈오그라드 인퍼런스를 가속화한다.
  • RSQ 미세조정과 INT8 윈오그라드 최적화를 통합하여 모바일 배포를 위한 유일한 파이프라인으로 통합한다.
  • 더 높은 효율성과 양자화에 대한 내성 향상을 갖춘 새로운 컨볼루션 1D를 탑재한 DFSMN 모델(ConvDFSMN)을 설계한다.

실험 결과

연구 질문

  • RQ1정밀도 오버플로우 또는 성능 저하 없이 INT8 양자화와 윈오그라드 컨볼루션을 효과적으로 결합할 수 있는가?
  • RQ2표준 후처리 양자화(PTQ)에 비해 RSQ가 양자화 후 모델 정확도를 어떻게 향상시키는가?
  • RQ3INT8 윈오그라드 가속화 후 최종 ASR 성능에 영향을 주는 미세조정 단계에서의 양자화 노이즈 최소화의 영향은 무엇인가?
  • RQ4제안된 파이프라인이 WER 성능을 유지하면서 ARMv7 모바일 디바이스에서 인퍼런스 지연을 얼마나 줄일 수 있는가?
  • RQ5실제 ASR 모델에서 표준 INT8 GEMM 및 PTQ 기반 윈오그라드에 비해 제안된 방법은 속도 향상과 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 RSQ 학습 방법은 양자화 오차를 줄이고 윈오그라드 변환에서 오버플로우를 방지하여 안정적인 INT8 윈오그라드 인퍼런스를 가능하게 한다.
  • Wav2letter 모델에서 이 방법은 ARMv7 기반 모바일 디바이스에서 최대 1.48배의 속도 향상을 달성하면서 WER가 0.07%만 증가한다.
  • RSQ 미세조정 후 ConvDFSMN-s 모델은 Aishell-1에서 10.52%의 WER를 기록하여 파arameter 수가 적음에도 불구하고 Wav2letter(13.71% WER)를 능가한다.
  • INT8 윈오그라드는 모든 Conv1D 커널 크기에서 일관된 속도 향상을 제공하며, Wav2letter에서 15×1 커널에서는 최대 1.3배의 속도 향상을 관찰했다.
  • RSQ 방법은 후처리 양자화에서 校정 세트(calibration sets)가 필요 없음을 제거하여 양자화 파이프라인을 단순화한다.
  • 1024차원 필터를 가진 ConvDFSMN에서 컨볼루션 1D 연산의 지연 시간이 최대 24% 감소(0.881ms에서 0.710ms로)하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.