Skip to main content
QUICK REVIEW

[논문 리뷰] Low-rank Adaptation of Large Language Model Rescoring for Parameter-Efficient Speech Recognition

Yu Yu, Chao-Han Huck Yang|arXiv (Cornell University)|2023. 09. 26.
Speech Recognition and SynthesisComputer Science인용 수 3
한 줄 요약

이 논문은 음성 인식 재점수를 위한 BERT 기반 언어 모델의 파라미터 효율적인 저질서 적응(LoRA) 방법인 LoRB를 제안한다. 모든 사전학습된 파라미터를 동결하고 총 파라미터 수의 0.08%에 해당하는 학습 가능한 저질서 행렬을 삽입함으로써, LoRB는 전체 미세조정 성능과 유사한 성능을 달성하면서도 최대 6배 빠른 학습 속도와 32% 낮은 메모리 사용량을 기록한다. 또한, 분류 기반 학습 목표와 상관관계 기반 정규화를 통해 다양한 도메인 간 일반화 능력을 유지한다.

ABSTRACT

We propose a neural language modeling system based on low-rank adaptation (LoRA) for speech recognition output rescoring. Although pretrained language models (LMs) like BERT have shown superior performance in second-pass rescoring, the high computational cost of scaling up the pretraining stage and adapting the pretrained models to specific domains limit their practical use in rescoring. Here we present a method based on low-rank decomposition to train a rescoring BERT model and adapt it to new domains using only a fraction (0.08%) of the pretrained parameters. These inserted matrices are optimized through a discriminative training objective along with a correlation-based regularization loss. The proposed low-rank adaptation Rescore-BERT (LoRB) architecture is evaluated on LibriSpeech and internal datasets with decreased training times by factors between 5.4 and 3.6.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)을 음성 인식 재점수에 적용할 때 발생하는 높은 계산 비용을 해결하기 위해.
  • 최소한의 파라미터 업데이트로 사전학습된 BERT 모델의 도메인 적응을 가능하게 하며, 추론 지연 시간 없이 구현하기 위해.
  • 저질서 미세조정에서 흔히 발생하는 성능 저하 문제를 완화하여, 예측 불가능한 도메인에 대한 일반화 능력을 향상시키기 위해.
  • 현저히 줄어든 학습 시간과 메모리 사용량으로도 경쟁적인 자동 음성 인식 성능을 달성하기 위해.
  • 모델 크기, 데이터 크기, 질서 구성 등에 따라 LoRA의 확장 성능를 평가하기 위해.

제안 방법

  • LoRA는 각 트랜스포머 레이어에 저질서 행렬 쌍을 삽입하여 BERT에 적용하며, 다른 모든 파라미터는 동결된 상태에서 학습된다.
  • ASR 성능을 직접 최적화하기 위해 단어 오류률(WER)을 최소화하는 분류 기반 학습 목표를 사용한다.
  • 표현의 안정성과 도메인 외 일반화 능력 저하를 방지하기 위해 상관관계 기반 정규화 손실을 도입한다.
  • 이 방법은 두 번째 단계 재점수에 적용되며, N개의 최선 후보 가설 목록이 적응된 BERT 모델을 사용해 재점수된다.
  • 이 방법은 여러 도메인과 모델 크기(5M, 170M, 1B 파라미터)에서 LibriSpeech 및 내부 데이터셋을 대상으로 평가된다.
  • 안정성이 향상되어 더 큰 학습률을 사용할 수 있어, 초기 수렴 속도가 느리더라도 더 빠른 수렴을 가능하게 한다.
Fig. 1 : Illustration of the Low-Rank adaptation based Rescoring BERT (LoRB).
Fig. 1 : Illustration of the Low-Rank adaptation based Rescoring BERT (LoRB).

실험 결과

연구 질문

  • RQ1저질서 적응이 BERT 기반 음성 인식 재점수에서 전체 미세조정 성능와 유사한 성능을 달성하면서도 최소한의 파라미터 업데이트로 가능할 수 있는가?
  • RQ2제안된 상관관계 기반 정규화가 표준 LoRA에 비해 도메인 외 테스트 세트에 대한 일반화 능력을 향상시키는가?
  • RQ3모델 크기와 데이터 스케일에 따라 LoRA의 학습 속도와 메모리 사용량이 전체 미세조정과 비교해 어떻게 다른가?
  • RQ4재점수 작업에서 모델 크기, 데이터 크기, 질서 구성에 따라 LoRA의 확장 성능는 어떻게 나타나는가?
  • RQ5제한된 내부 도메인 데이터로 특정 도메인에 적응하면서도, 타겟 도메인이 아닌 도메인에서 성능를 유지할 수 있는가?

주요 결과

  • LoRB는 전체 미세조정에서 업데이트하는 파라미터의 0.08%만 사용하면서도, 타겟 도메인이 아닌 Shopping 도메인에서 기준 모델 대비 상대적 WER 향상 +0.23%를 달성한다.
  • LoRB는 전체 미세조정 대비 학습 시간을 3.6배에서 5.4배 감소시키며, 더 큰 학습률을 사용할 경우 최대 6배 빠른 속도를 기록한다.
  • LoRB는 학습 중 GPU 메모리 사용량을 87%에서 52%로 감소시켜 학습 효율성을 크게 향상시킨다.
  • LoRB와 전체 미세조정 간 성능 격차는 170M 파라미터에서 -22.3% WER 상대적 격차에서 1B 파라미터에서 +2.4%로 줄어들며, 더 큰 모델에서의 우수한 확장성 잠재력을 보여준다.
  • LoRB는 데이터 크기에 따라 로그 스케일링 곡선을 보이며, 15만 개 이상의 학습 발화 수를 초과하면 수익 감소 현상이 나타나지만, 전체 미세조정에서 관찰되는 선형 스케일링과는 대조된다.
  • LoRB는 더 큰 백본 모델에서 더 빠른 수렴 속도를 보이며, 1B 파라미터 BERT에서 2.74배 빠른 수렴 속도를 달성한다.
Fig. 2 : Wall-clock training time of LoRB, LoRB+ $\mathcal{L}_{cor}$ and Fine-Tuning (FT) when training on messaging data.
Fig. 2 : Wall-clock training time of LoRB, LoRB+ $\mathcal{L}_{cor}$ and Fine-Tuning (FT) when training on messaging data.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.