Skip to main content
QUICK REVIEW

[논문 리뷰] FitHuBERT: Going Thinner and Deeper for Knowledge Distillation of Speech Self-Supervised Learning

Yeonghyeon Lee, Kangwook Jang|arXiv (Cornell University)|2022. 07. 01.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

FitHuBERT는 음성의 자기지도 학습을 위한 지식 정복을 위해 더 얇고 깊은 학생 모델을 제안하며, HuBERT의 크기를 23.8%로 줄이고 추론 시간을 64.1% 감소시켜 2.8배 빠르게 하면서도 힌트 기반 정복과 가속화 가능한 시간 감소 레이어를 통해 SUPERB 벤치마크에서 12.1% WER와 13.3% PER의 최신 기술 성능을 달성한다.

ABSTRACT

Large-scale speech self-supervised learning (SSL) has emerged to the main field of speech processing, however, the problem of computational cost arising from its vast size makes a high entry barrier to academia. In addition, existing distillation techniques of speech SSL models compress the model by reducing layers, which induces performance degradation in linguistic pattern recognition tasks such as phoneme recognition (PR). In this paper, we propose FitHuBERT, which makes thinner in dimension throughout almost all model components and deeper in layer compared to prior speech SSL distillation works. Moreover, we employ a time-reduction layer to speed up inference time and propose a method of hint-based distillation for less performance degradation. Our method reduces the model to 23.8% in size and 35.9% in inference time compared to HuBERT. Also, we achieve 12.1% word error rate and 13.3% phoneme error rate on the SUPERB benchmark which is superior than prior work.

연구 동기 및 목표

  • HuBERT와 같은 대규모 음성 자기지도 학습(SSL) 모델의 높은 계산 비용과 큰 모델 크기로 인해 학술적 및 실용적 활용이 제한되는 문제를 해결한다.
  • 기존 정복 방법이 모델 깊이를 줄여서 발생하는 언어 패턴 인식 작업(예: 음소 인식 및 음성 인식)에서의 성능 저하 문제를 해결한다.
  • 이전 정복 접근 방식과는 달리 차원은 얕고 층 수는 더 많은 학생 모델을 설계하여 더 나은 파라미터 효율성과 성능 유지 가능성을 확보한다.
  • 정확도를 훼손하지 않고 추론 속도를 높이기 위해 학습 가능한 시간 감소 레이어를 도입한다.
  • 교사 모델의 다수의 중간 레이어에서 지식을 전달하기 위해 힌트 기반 정복 기법을 제안하여 학생 모델의 성능 향상을 도모한다.

제안 방법

  • 점별 컨볼루션을 활용한 채널 증가형 CNN 특징 추출기 설계로, 파라미터 수를 줄이면서도 특징 표현력을 향상시킨다.
  • Transformer 블록 내에서 자기주의성 메커니즘의 차원을 37.5% 감소시키고 피드포워드 네트워크 내부 레이어의 차원을 84.3% 감소시켜 더 얇은 모델을 만든다.
  • 교사 모델과 동일한 12개의 Transformer 레이어를 유지하여 표현력의 깊이를 보존함으로써 아키텍처적으로 더 깊은 모델을 구현한다.
  • 교사 및 학생 모델의 중간 레이어 표현(특징)을 일치시키는 힌트 기반 정복을 구현하며, 일치를 유도하는 손실 함수를 사용한다.
  • 추론 중 시퀀스 길이를 다운샘플링하는 학습 가능한 시간 감소 레이어를 도입하여 계산 부담을 줄이고 처리 속도를 향상시킨다.
  • 교사 및 학생 모델 간 차원 불일치 문제를 해결하기 위해 레이어별 예측 헤드를 사용하여 안정적인 훈련을 보장한다.

실험 결과

연구 질문

  • RQ1더 얇고 깊은 학생 아키텍처는 기존 정복 방법에 비해 언어 패턴 인식 작업에서 모델 효율성과 성능 측면에서 뛰어나게 작용할 수 있는가?
  • RQ2다양한 중간 레이어의 정보를 활용한 힌트 기반 정복은 최종 레이어 출력만을 사용하는 정복 방식보다 학생 모델의 성능을 향상시키는가?
  • RQ3학습 가능한 시간 감소 레이어는 정확도를 훼손하지 않으면서 얼마나 추론 시간을 줄일 수 있는가?
  • RQ4FitHuBERT는 파라미터 수, 추론 속도, SUPERB의 하류 작업 성능 측면에서 이전 정복 기법과 비교해 어떤가?
  • RQ5왜 국소적(예: PR, ASR)과 전역적(예: SID) 분류 작업 간 성능 저하 패턴이 다를까?

주요 결과

  • FitHuBERT는 원본 HuBERT 대비 모델 크기를 23.8%로 줄이고 추론 시간을 64.1% 감소시켜 교사 모델 대비 2.8배 빠르게 한다.
  • SUPERB 벤치마크에서 FitHuBERT는 12.1% WER와 13.3% 음소 오류율(PER)을 달성하여 DistilHuBERT와 같은 이전 정복 방법을 초월한다.
  • 모든 12개의 힌트 레이어를 정복에 사용한 모델가 최고의 성능(94.20% IC 정확도, 12.66% WER)을 기록하며, 다중 레이어 힌트가 지식 전달을 크게 향상시킴을 보여준다.
  • 비율 k=1(감소 없음)인 시간 감소 레이어가 표준 FitHuBERT-100보다 더 높은 성능을 보이며, 추론 속도가 중요하지 않은 경우 시간 감소 레이어를 생략할 수 있음을 시사한다.
  • 스피커 식별(SID)과 같은 전역 분류 작업에서 성능 저하가 더 두드러지며, 아키텍처 설계로 인해 국소적 언어 패턴에 치우친 경향이 있음을 나타낸다.
  • CNN 아키텍처에서 점별 컨볼루션을 사용함으로써 채널 간 특징 상호작용이 가능해져 고정 채널 설계 대비 2.56% 정확도 향상을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.