Skip to main content
QUICK REVIEW

[논문 리뷰] Essence Knowledge Distillation for Speech Recognition

Zhenchuan Yang, Chun Zhang|arXiv (Cornell University)|2019. 06. 26.
Speech Recognition and Synthesis참고 문헌 23인용 수 6
한 줄 요약

이 논문은 음성 인식을 위한 본질 지식 distillation(Essence Knowledge Distillation, EKD)을 제안한다. 여기서는 교사 앙상블 모델의 상위-k개의 가장 확신 있는 소프트 레이블만을 사용하여 더 작은 학생 모델을 훈련시킨다. 놀랍게도 학생 모델은 개별 교사 모델과 전체 앙상블 모두를 능가하며, 본질적인 지식에 집중하고 하드 레이블과 다중 작업 학습을 통해 조합함으로써 계산 비용을 크게 줄이고 Switchboard에서 최신 기준 성능을 달성한다.

ABSTRACT

It is well known that a speech recognition system that combines multiple acoustic models trained on the same data significantly outperforms a single-model system. Unfortunately, real time speech recognition using a whole ensemble of models is too computationally expensive. In this paper, we propose to distill the knowledge of essence in an ensemble of models (i.e. the teacher model) to a single model (i.e. the student model) that needs much less computation to deploy. Previously, all the soften outputs of the teacher model are used to optimize the student model. We argue that not all the outputs of the ensemble are necessary to be distilled. Some of the outputs may even contain noisy information that is useless or even harmful to the training of the student model. In addition, we propose to train the student model with a multitask learning approach by utilizing both the soften outputs of the teacher model and the correct hard labels. The proposed method achieves some surprising results on the Switchboard data set. When the student model is trained together with the correct labels and the essence knowledge from the teacher model, it not only significantly outperforms another single model with the same architecture that is trained only with the correct labels, but also consistently outperforms the teacher model that is used to generate the soft labels.

연구 동기 및 목표

  • 실시간 음성 인식 시스템에 앙상블 음성 모델을 구현할 때 발생하는 높은 계산 비용을 해결하기 위해.
  • 전체 소프트 레이블 디스틸레이션에서 노이즈와 관련 없는 정보를 피하여 학생 모델의 일반화 성능을 향상시키기 위해.
  • 교사 앙상블에서 가장 두드러진 지식만 디스틸링하는 것이 전체 디스틸레이션보다 더 나은 성능을 낼 수 있는지 탐구하기 위해.
  • 다중 작업 학습 프레임워크 내에서 하드 레이블과 디스틸된 본질 지식을 조합할 경우 학생 모델의 일반화 성능 향상 여부를 조사하기 위해.
  • 성능을 극대화하면서 계산 비용을 최소화할 수 있는 최적의 k 값을 결정하기 위해.

제안 방법

  • 교사 모델은 데이터 증강을 위해 속도 변형된 데이터로 훈련된 두 가지 다원적인 음성 모델인 TDNN과 TDNN-LSTM의 융합으로 구성된다.
  • 교사 모델의 소프트맥스 확률을 사용하여 상위-k개의 가장 확신 있는 출력 레이블을 식별하고, 이를 디스틸레이션을 위한 '본질 지식'으로 선정한다.
  • 학생 모델은 다중 작업 목적 함수를 사용하여 훈련된다: 참값 하드 레이블에 대한 교차 엔트로피 손실과 교사의 상위-k개 소프트 레이블만을 사용한 디스틸레이션 손실을 동시에 최소화한다.
  • 교사의 출력 확률이 이미 효과적인 지식 전달을 위해 충분히 부드럽기 때문에, 디스틸레이션 온도 T는 1로 설정된다.
  • 모든 모델에서 공통된 결정 트리를 사용하여 출력 차원의 일관성을 확보한다(8912개의 노드), 이를 통해 직접 비교가 가능해진다.
  • 성능에 미치는 지식 선택의 영향을 평가하기 위해 다양한 k 값(1, 5, 10, 20, 50, 1000, 8912)을 사용하여 학생 모델을 훈련시는 것을 수행한다.

실험 결과

연구 질문

  • RQ1교사 앙상블 모델의 상위-k개의 가장 확신 있는 소프트 레이블만 디스틸링하는 것이 전체 디스틸레이션보다 더 나은 성능을 낼 수 있는가?
  • RQ2디스틸된 본질 지식과 하드 레이블을 다중 작업 학습 환경에서 조합하면 학생 모델의 일반화 성능이 향상되는가?
  • RQ3본질 지식을 사용하여 훈련된 더 작은 학생 모델이 원래의 교사 앙상블 모델을 능가할 수 있는가?
  • RQ4정확도와 훈련 효율성 측면에서 디스틸레이션에 최적의 k 값은 무엇인가?
  • RQ5k 값이 너무 클 경우 성능이 떨어지며, 노이즈 또는 관련 없는 레이블에 과적합되는가?

주요 결과

  • Switchboard 서브셋에서, k=5를 사용한 학생 모델은 TOTAL 세트에서 16.7%의 단어 오류율(WER)을 기록하여 교사 모델의 17.2%를 초월했다.
  • 전체 Switchboard 데이터셋에서, k=5를 사용한 학생 모델은 TOTAL 세트에서 16.7%의 WER을 기록하여 교사 모델의 17.2%를 뛰어넘었다.
  • k=1을 사용한 학생 모델은 전체 데이터셋에서 17.1%의 WER을 기록하여 교사 모델의 17.2%를 略히 뛰어넘었다.
  • k를 1000으로 늘였을 때 학생 모델의 성능이 떨어졌으며, 이는 너무 많은 레이블을 포함시킬 경우 노이즈가 유입되어 일반화 성능에 악영향을 준다는 것을 시사한다.
  • 하드 레이블과 함께 k=5로 훈련된 학생 모델은 항상 교사 모델과 하드 레이블 전용으로 훈련된 학생 모델보다 뛰어난 성능을 보였다.
  • 이 방법은 모델 크기와 추론 비용을 크게 줄였고, Switchboard에서 최신 기준 성능을 달성하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.