Skip to main content
QUICK REVIEW

[논문 리뷰] Compressing LSTMs into CNNs.

Krzysztof J. Geras, Abdelrahman Mohamed|arXiv (Cornell University)|2015. 11. 19.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 새로운 모델 압축 기법인 모델 블렌딩을 사용하여 LSTMs를 깊이 있는 합성곱 신경망(CNNs)으로 압축하는 방법을 제안한다. 여기서 CNN 학생 모델은 LSTM 교사 모델의 지도를 받으며 학습된다. 이 방법은 독립적인 LSTMs와 CNNs보다 높은 정확도를 달성하며, 효과적인 지식 전이를 위해 최고 확률 레이블의 1퍼센트 미만으로도 충분하다.

ABSTRACT

We consider whether deep convolutional networks (CNNs) can represent decision functions with similar accuracy as recurrent networks such as LSTMs. First, we show that a deep CNN with an architecture inspired by the models recently introduced in image recognition can yield better accuracy than previous convolutional and LSTM networks on the standard 309h Switchboard automatic speech recognition task. Then we show that even more accurate CNNs can be trained under the guidance of LSTMs using a variant of model compression, which we call model blending because the teacher and student models are similar in complexity but different in inductive bias. Blending further improves the accuracy of our CNN, yielding a computationally efficient model of accuracy higher than any of the other individual models. Examining the effect of dark knowledge in this model compression task, we find that less than 1% of the highest probability labels are needed for accurate model compression.

연구 동기 및 목표

  • 깊이 있는 CNNs가 자동 음성 인식과 같은 시퀀스 모델링 작업에서 LSTMs의 성능을 따라하거나 뛰어넘을 수 있는지 조사하는 것.
  • LSTMs에서 CNNs로 지식을 전이하는 모델 압축 기법을 탐색하며, 이들의 상호보완적인 인도적 편향을 활용하는 것.
  • 특히 교사 모델의 최상위 예측 확률만을 사용할 때 지식 전이의 효과를 평가하는 것.

제안 방법

  • Switchboard 309h 음성 인식 작업을 위해 최신 이미지 인식 모델의 아키텍처를 영감으로 삼은 깊이 있는 CNN을 훈련하는 것.
  • 모델 블렌딩 도입 — 지식 전이의 변종으로, CNN 학생 모델이 LSTM 교사 모델의 소프트 레이블을 사용해 학습되는 방식.
  • 어두운 지식 전이 적용 — LSTM에서 최상위 1퍼센트의 높은 확률 레이블만을 사용해 CNN의 학습을 이끄는 방식.
  • 계산 효율성을 유지하면서도 LSTM의 결정 함수를 모방하도록 CNN을 최적화하는 것.
  • 학생 모델의 출력 분포를 교사 모델의 분포와 일치시키는 손실 함수를 사용하며, 특히 고신뢰도 예측에 집중하는 것.

실험 결과

연구 질문

  • RQ1깊이 있는 CNNs가 Switchboard 309h 자동 음성 인식 작업에서 LSTMs를 초월하는 정확도를 달성할 수 있는가?
  • RQ2LSTM의 지도를 받는 CNN 학습(모델 블렌딩)이 개별 모델보다 성능을 향상시키는가?
  • RQ3교사 모델의 최상위 예측 중 소수의 비율만을 사용할 때 지식 전이의 효과는 어떠한가?
  • RQ4LSTMs와 CNNs 간의 인도적 편향 차이가 모델 압축 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 CNN 아키텍처는 Switchboard 309h ASR 작업에서 이전의 합성곱 및 LSTM 네트워크를 모두 뛰어넘는 성능을 보였다.
  • LSTM 교사 모델과의 모델 블렌딩은 개별 모델보다도 CNN의 정확도를 더욱 향상시켰다.
  • LSTM 교사 모델의 최상위 1퍼센트 확률 레이블만을 사용해도 매우 정확한 모델 압축이 가능했다.
  • 결과로 도출된 CNN 모델는 상태최저 정확도를 달성하면서도 계산 효율성이 높았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.