Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient conformer: Progressive downsampling and grouped attention for automatic speech recognition

Maxime Burchi, Valentin Vielzeuf|arXiv (Cornell University)|2021. 08. 31.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 계산 복잡도를 줄이기 위해 점진적 다운샘플링과 그룹화된 어텐션을 조합한 최적화된 ASR 아키텍처인 Efficient Conformer를 제안한다. 그룹화된 어텐션을 적용하여 자기어텐션 복잡도를 O(n²d)에서 O(n²d/g)로 감소시키고, 스트라이드 다중헤드 어텐션을 사용해 전역 다운샘플링을 구현함으로써 표준 Conformer 대비 29% 빠른 추론과 36% 빠른 학습을 달성하면서도, 13M 파라미터 모델로 LibriSpeech test-clean/test-other에서 각각 2.7%/6.7%의 경쟁력 있는 WER를 유지한다.

ABSTRACT

The recently proposed Conformer architecture has shown state-of-the-art performances in Automatic Speech Recognition by combining convolution with attention to model both local and global dependencies. In this paper, we study how to reduce the Conformer architecture complexity with a limited computing budget, leading to a more efficient architecture design that we call Efficient Conformer. We introduce progressive downsampling to the Conformer encoder and propose a novel attention mechanism named grouped attention, allowing us to reduce attention complexity from $O(n^{2}d)$ to $O(n^{2}d / g)$ for sequence length $n$, hidden dimension $d$ and group size parameter $g$. We also experiment the use of strided multi-head self-attention as a global downsampling operation. Our experiments are performed on the LibriSpeech dataset with CTC and RNN-Transducer losses. We show that within the same computing budget, the proposed architecture achieves better performances with faster training and decoding compared to the Conformer. Our 13M parameters CTC model achieves competitive WERs of 3.6%/9.0% without using a language model and 2.7%/6.7% with an external n-gram language model on the test-clean/test-other sets while being 29% faster than our CTC Conformer baseline at inference and 36% faster to train.

연구 동기 및 목표

  • 자원 제약 환경에서의 효율적 배포를 위해 Conformer 아키텍처의 계산 복잡도를 감소시키기 위해.
  • 초기 인코더 스테이지에서 긴 시퀀스 길이로 인해 발생하는 어텐션 레이어의 계산 비대칭 문제를 해결하기 위해.
  • 제한된 GPU 예산(4x RTX 2080 Ti) 하에서 추론 및 학습 시간을 단축하면서도 높은 ASR 성능을 유지하기 위해.
  • 시퀀스 길이에 따라 잘 스케일링되며 메모리 사용을 줄이는 효율적인 어텐션 메커니즘을 탐색하기 위해.
  • CTC 및 RNN-Transducer 손실을 사용하여 LibriSpeech에서 점진적 다운샘플링과 어텐션 변형의 효과를 평가하기 위해.

제안 방법

  • 세 단계에 걸쳐 시퀀스 길이를 8배로 감소시키는 점진적 다운샘플링을 Conformer 인코더에 도입한다.
  • 이웃한 시간 단위를 특징 차원에 따라 그룹화함으로써 자기어텐션 복잡도를 O(n²d)에서 O(n²d/g)로 감소시키는 그룹화된 어텐션을 제안한다.
  • 일부 구성에서 컨볼루션 다운샘플링을 대체하기 위해 스트라이드 다중헤드 자기어텐션을 전역 다운샘플링 연산으로 적용한다.
  • 시퀀스 길이가 가장 긴 초기 인코더 스테이지에서 그룹화된 어텐션을 적용하여 계산 병목 현상을 완화한다.
  • 정확도와 효율성 측면에서 그룹 크기, 어텐션 창 크기, 어텐션 변형을 평가하기 위해 아블레이션 스터디를 수행한다.
  • 4-GPU 학습 예산 하에서 CTC 및 RNN-Transducer 목표 함수를 사용해 LibriSpeech에서 모델을 학습한다.

실험 결과

연구 질문

  • RQ1Conformer 기반 ASR 모델에서 점진적 다운샘플링이 정확도를 훼손하지 않으면서도 계산 비용을 효과적으로 줄일 수 있는가?
  • RQ2그룹화된 어텐션은 긴 시퀀스 환경에서 성능을 유지하면서 자기어텐션 복잡도를 어떻게 감소시키는가?
  • RQ3컨볼루션 다운샘플링을 스트라이드 다중헤드 자기어텐션으로 대체할 경우, 지연 시간을 줄이면서도 동등하거나 더 나은 성능을 낼 수 있는가?
  • RQ4속도-정확도 트레이드오���에서 고려할 때, 그룹화된 어텐션의 최적의 그룹 크기는 인코더 스테이지 전반에 걸쳐 어떤가?
  • RQ5지역 어텐션과 그룹화된 어텐션은 추론 속도와 인식 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 13M 파라미터의 Efficient Conformer CTC 모델은 외부 n-gram 언어 모델을 사용할 때 LibriSpeech test-clean에서 2.7% WER, test-other에서 6.7% WER를 기록하여 최신 기술 수준의 성능을 달성한다.
  • 동일한 4-GPU 예산 하에서 표준 Conformer 기준선 대비 추론 시간을 29% 단축하고 학습 시간을 36% 단축한다.
  • 첫 번째 스테이지에서만 그룹화된 어텐션을 적용할 경우, 성능 저하 없이 추론 속도를 21% 향상시키고 학습을 35% 빠르게 한다.
  • 모든 세 단계에 그룹화된 어텐션을 적용하면 추론 속도는 29% 향상되고 학습 시간은 41% 단축되지만, 어텐션 컨텍스트가 감소하여 WER가 약간 증가(6.7%에서 3.56%로)한다.
  • 175 창 크기의 지역 어텐션은 전체 어텐션과 유사한 성능를 보이나, 시퀀스 패딩 오버헤드로 인해 더 느리며, 이는 그룹화된 어텐션의 효율성 우수성을 부각시킨다.
  • 특히 긴 시퀀스에서 그룹화된 어텐션은 더 나은 시퀀스 분할 처리와 감소된 계산 오버헤드 덕분에 메모리 효율성과 추론 속도 측면에서 지역 어텐션을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.