Skip to main content
QUICK REVIEW

[논문 리뷰] HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition

Ji Won Yoon, Beom Jun Woo|arXiv (Cornell University)|2022. 04. 13.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

HuBERT-EE는 HuBERT 모델의 중간 레이어에 경량 브랜치를 다수 삽입하여 예측 신뢰도가 높을 경우 조기 종료를 허용하는 동적 조기 종료 메커니즘을 제안함으로써 효율적인 음성 인식을 실현한다. LibriSpeech에서 전체 모델을 재학습하지 않고도 최대 24% 빠른 추론 속도를 달성하면서 WER는 3% 미만으로 증가시키며, 속도와 정확도의 균형을 유지한다.

ABSTRACT

Pre-training with self-supervised models, such as Hidden-unit BERT (HuBERT) and wav2vec 2.0, has brought significant improvements in automatic speech recognition (ASR). However, these models usually require an expensive computational cost to achieve outstanding performance, slowing down the inference speed. To improve the model efficiency, we introduce an early exit scheme for ASR, namely HuBERT-EE, that allows the model to stop the inference dynamically. In HuBERT-EE, multiple early exit branches are added at the intermediate layers. When the intermediate prediction of the early exit branch is confident, the model stops the inference, and the corresponding result can be returned early. We investigate the proper early exiting criterion and fine-tuning strategy to effectively perform early exiting. Experimental results on the LibriSpeech show that HuBERT-EE can accelerate the inference of the HuBERT while simultaneously balancing the trade-off between the performance and the latency.

연구 동기 및 목표

  • HuBERT와 같은 대규모 자기지도 학습 음성 모델의 높은 추론 지연 문제를 해결하여 실시간 배포를 가능하게 한다.
  • 양자화나 distillation과 같은 기존 효율 기법에도 불구하고 대규모 아키텍처에서 전체 모델 추론의 비효율성을 극복한다.
  • 자동 음성 인식(ASR)에 특화된 새로운 조기 종료 메커니즘을 설계하며, 특히 CTC 기반 모델은 표준 분류 작업과 다름을 고려한다.
  • 백본 모델을 재학습하지 않고도 추론 속도와 인식 정확도 사이의 동적이고 구성 가능한 트레이드오프를 가능하게 한다.
  • 프레임 단위 ASR 환경에서 성능과 계산 효율성을 균형 잡기 위해 조기 종료 브랜치의 구조와 배치를 최적화한다.

제안 방법

  • HuBERT-large 모델의 중간 레이어(5번째, 10번째, 15번째, 20번째)에 다수의 조기 종료 브랜치를 삽입하며, 각 브랜치는 예측을 위해 자기주의성 메커니즘과 선형 투영을 갖춘다.
  • 신뢰도 점수와 엔트로피를 조기 종료 기준으로 사용: 신뢰도 > 0.955 또는 엔트로피 < 0.0035일 경우 종료하여 프레임 단위 의사결정을 가능하게 한다.
  • 조기 종료 브랜치를 백본과 함께 엔드 투 엔드 미세조정을 통해 공동으로 학습하여 CTC 목표 함수에 따라 일치시키며, 순서 기반 ASR을 유지한다.
  • 조기 종료 브랜치의 복잡도를 다양하게 조절하기 위해 자기주의성 차원(D_EE = 512, 1024, 2048)을 변화시켜 성능-효율성 트레이드오프를 연구한다.
  • 추론 중에 동적으로 조기 종료를 적용: 브랜치의 예측이 신뢰도 또는 엔트로피 기준을 충족하면 나머지 레이어를 건너뛰고 결과를 즉시 반환한다.
  • 다양한 임계값과 브랜치 구성에서 품질-효율성 트레이드오프를 평가하기 위해 dev-clean 및 test-clean 세트를 사용한다.
(b) Proposed approach
(b) Proposed approach

실험 결과

연구 질문

  • RQ1CTC 기반 자동 음성 인식 모델에 조기 종료를 효과적으로 적용할 수 있는가? 이는 표준 분류 작업과 다름을 고려할 때 중요하다.
  • RQ2HuBERT와 같은 깊은 Transformer 기반 ASR 모델에서 조기 종료 브랜치의 최적의 위치와 복잡도는 무엇인가?
  • RQ3LibriSpeech에서 신뢰도 기반과 엔트로피 기반의 종료 기준은 추론 속도 향상과 WER 성능 측면에서 어떻게 비교되는가?
  • RQ4HuBERT-EE는 전체 HuBERT-large 모델과 비교해 얼마나 빠른 추론을 달성할 수 있으며, 경쟁 가능한 WER를 유지할 수 있는가?
  • RQ5사용자가 설정할 수 있는 종료 임계값에 따라 재학습 없이도 모델이 추론 속도-정확도 트레이드오프를 런타임에서 유연하게 조정할 수 있는가?

주요 결과

  • HuBERT-EE는 dev-clean 세트에서 최대 24%의 추론 속도 향상을 달성했으며, WER는 0.93% 증가(2.02%에서 2.95%)에 그쳐 강력한 효율성 향상을 입증했다.
  • 엔트로피 기반 종료 기준(임계값 < 0.0035)이 대부분의 경우에 신뢰도 기반 기준(임계값 > 0.955)을 능가했으며, 특히 dev-clean 및 test-clean 세트에서 더 빠른 추론과 더 나은 WER를 기록했다.
  • 더 깊은 레이어(예: 20번째 레이어)에 위치한 조기 종료 브랜치는 전체 HuBERT 모델과 유사한 WER(2.02%)를 달성했지만, 浅층 브랜치는 상당히 열 劣한 성능을 보였다.
  • 조기 종료 브랜치의 자기주의성 차원 D_EE = 1024일 경우 품질-효율성 트레이드오프가 가장 우수했으며, D_EE = 2048일 경우 성능이 악화됨(ERO 2.97%)하고 오히려 음의 속도 향상(-0.24%)을 보여, 수익 감소 현상을 확인했다.
  • 모든 데이터셋에서 경쟁 가능한 WER를 유지했으며, dev-clean 및 test-clean 세트에서 3% 미만의 WER 감소를 보였고, 임계값 조정을 통한 속도 및 정확도 조절의 유연성을 보였다.
  • 이 방법은 재학습 없이도 런타임에서 구성 가능한 추론 속도를 제공하여, 다양한 자원 제약 조건에서 실세계 배포에 적합하다.
Figure 2: Comparison of each early exit’s WER (%) and its certainty, including the confidence and the entropy. To better understand the behaviour, we varied the self-attention dimension $D_{EE}$ of the early exit branch from 512 to 2048. All the values were measured on LibriSpeech dev-clean dataset.
Figure 2: Comparison of each early exit’s WER (%) and its certainty, including the confidence and the entropy. To better understand the behaviour, we varied the self-attention dimension $D_{EE}$ of the early exit branch from 512 to 2048. All the values were measured on LibriSpeech dev-clean dataset.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.