Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Adapters for Giant Speech Models

Nanxin Chen, Izhak Shafran|arXiv (Cornell University)|2023. 06. 13.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 Conformer 기반 거대 음성 모델을 위한 새로운 어댑터 아키텍처인 두 개의 병렬 어댑터(TPA)를 제안한다. TPA는 각 블록의 두 개의 피드포워드 네트워크에 병렬 잔차 어댑터를 삽입한다. TPA는 전체 미세조정 성능과 유사한 성능을 달성하며, 50%의 음성 인식 벤치마크에서 이를 따라하거나 초월한다. 이는 전용 파라미터의 1.4%에서 11%만 업데이트함으로써 달성되며, 미세조정되지 않은 사전 훈련된 인코더를 유지하면서 효율적이고 작업에 특화된 적응을 가능하게 한다.

ABSTRACT

Large pre-trained speech models are widely used as the de-facto paradigm, especially in scenarios when there is a limited amount of labeled data available. However, finetuning all parameters from the self-supervised learned model can be computationally expensive, and becomes infeasiable as the size of the model and the number of downstream tasks scales. In this paper, we propose a novel approach called Two Parallel Adapter (TPA) that is inserted into the conformer-based model pre-trained model instead. TPA is based on systematic studies of the residual adapter, a popular approach for finetuning a subset of parameters. We evaluate TPA on various public benchmarks and experiment results demonstrates its superior performance, which is close to the full finetuning on different datasets and speech tasks. These results show that TPA is an effective and efficient approach for serving large pre-trained speech models. Ablation studies show that TPA can also be pruned, especially for lower blocks.

연구 동기 및 목표

  • 거대한 사전 훈련된 음성 모델에서 전체 미세조정의 계산 및 저장소 비효율 문제를 해결한다.
  • 최소한의 파라미터 업데이트로 저자원 환경에서의 치명적 기억 상실 및 과적합 문제를 해결한다.
  • 다양한 음성 작업 및 多국어 설정과 호환 가능한 일반적인, 효율적인 적응 방법을 개발한다.
  • 인코더를 재훈련하지 않고도 여러 하류 작업에 걸쳐 거대 음성 모델을 확장 가능한 방식으로 구현할 수 있도록 한다.
  • 잔차 어댑터의 구조적 및 아키텍처적 요소를 조사하여 최적화되고, 잘라내기 가능한, 높은 성능을 보이는 변형을 설계한다.

제안 방법

  • 각 Conformer 블록의 두 피드포워드 네트워크(FFN1 및 FFN2)에 삽입되는 이중 분지 잔차 어댑터인 두 개의 병렬 어댑터(TPA)를 제안한다.
  • 두 개의 완전히 연결된 레이어와 ReLU 활성화 함수를 포함한 잔차 연결을 사용하며, 선택적으로 배치 정규화를 포함할 수 있다.
  • 훈련 중에 사전 훈련된 Conformer 인코더를 동결하여, TPA와 무작위로 초기화된 디코더만 업데이트한다.
  • 최적의 구성 요소를 식별하기 위해 어댑터 구성 요소(예: 배치 정규화, ReLU, 깊이, 너비)에 대한 체계적 아블레이션 연구를 수행한다.
  • 활성도 통계 기반으로 하위 레이어에서 특히 TPA 구성 요소에 대해 반복적인 뉴런 제거를 구현한다.
  • 동일한 동결된 인코더가 작업에 특화된 TPA와 디코더 헤드를 통해 여러 하류 작업을 지원하는 통합 프레임워크를 구현한다.

실험 결과

연구 질문

  • RQ1이중 분지 어댑터 아키텍처(TPA)가 음성 인식 및 번역 작업에서 표준 순차적 또는 단일 분지 잔차 어댑터보다 우월한 성능을 내는가?
  • RQ2TPA의 아키텍처 설계(예: 배치 정규화, 너비, 깊이)가 성능 및 파라미터 효율성에 어떤 영향을 미치는가?
  • RQ3특히 하위 블록과 상위 블록에서 TPA는 얼마나 잘라내도 성능 저하 없이 유지될 수 있는가?
  • RQ4다양한 음성 벤치마크에서 TPA는 전용 파라미터의 소수만 업데이트하면서도 전체 미세조정 수준에 근접한 성능를 유지할 수 있는가?
  • RQ5TPA는 다국어 ASR 및 다국어 음성 번역을 포함한 여러 음성 작업에 일반화 가능한가?

주요 결과

  • CoVoST 2 다국어 음성 번역에서 TPA는 전체 미세조정과 0.9 BLEU 이내 성능를 달성하며, 파라미터의 1.4%만 업데이트한다.
  • LibriSpeech에서 TPA는 클린 셋에서 WER 1.9%를 기록하고, 다른 셋에서는 3.7%를 기록하며, 전체 미세조정 성능를 11%의 파라미터 업데이트로 따라잡는다.
  • AMI 및 Switchboard와 같은 도전적인 데이터셋에서 TPA는 전체 미세조정보다 0.3 WER 이내로 약간 낮거나 동일한 성능를 기록하며, 파라미터의 2%만 업데이트한다.
  • 아블레이션 연구 결과, 두 번째 FFN 블록의 뉴런 중 최대 60~80%를 성능 손실 없이 제거할 수 있으며, 특히 하위 레이어에서 그러한 효과가 뚜렷하다.
  • 동결된 인코더의 경우 제거 효과가 덜 뚜렷하지만, 블록 2~10에서는 뉴런의 20~40%를 제거해도 성능 저하 없이 유지되며, 이는 추론 속도 향상 잠재력이 있음을 시사한다.
  • 이전 연구에서 보고된 순차적 및 병렬 어댑터 변형보다 TPA가 뛰어난 파라미터 효율성과 정확도를 보이며, 성능가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.