Skip to main content
QUICK REVIEW

[논문 리뷰] Grow and Prune Compact, Fast, and Accurate LSTMs

Xiaoliang Dai, Hongxu Yin|arXiv (Cornell University)|2018. 05. 30.
Multimodal Machine Learning Applications참고 문헌 33인용 수 15
한 줄 요약

이 논문은 압축형, 빠르고 정확한 모델을 만들기 위해 은닉층을 가진 LSTMs(H-LSTM)와 성장 및 자르기(GP) 학습을 제안한다. LSTM 제어 게이트에 내부 은닉층을 추가하고 기울기 기반 성장과 크기 기반 자르기를 사용함으로써, 모델의 파라미터 수를 최대 38.7배, FLOPs를 45.5배, 지연 시간(latency)을 4.5배 감소시키며, 음성 인식에서 CIDEr 점수는 2.6점 향상되고 WER는 12.9%에서 8.7%로 감소시킨다.

ABSTRACT

Long short-term memory (LSTM) has been widely used for sequential data modeling. Researchers have increased LSTM depth by stacking LSTM cells to improve performance. This incurs model redundancy, increases run-time delay, and makes the LSTMs more prone to overfitting. To address these problems, we propose a hidden-layer LSTM (H-LSTM) that adds hidden layers to LSTM's original one level non-linear control gates. H-LSTM increases accuracy while employing fewer external stacked layers, thus reducing the number of parameters and run-time latency significantly. We employ grow-and-prune (GP) training to iteratively adjust the hidden layers through gradient-based growth and magnitude-based pruning of connections. This learns both the weights and the compact architecture of H-LSTM control gates. We have GP-trained H-LSTMs for image captioning and speech recognition applications. For the NeuralTalk architecture on the MSCOCO dataset, our three models reduce the number of parameters by 38.7x [floating-point operations (FLOPs) by 45.5x], run-time latency by 4.5x, and improve the CIDEr score by 2.6. For the DeepSpeech2 architecture on the AN4 dataset, our two models reduce the number of parameters by 19.4x (FLOPs by 23.5x), run-time latency by 15.7%, and the word error rate from 12.9% to 8.7%. Thus, GP-trained H-LSTMs can be seen to be compact, fast, and accurate.

연구 동기 및 목표

  • 딥 LSTM에서 모델 정확도, 추론 속도, 파라미터 효율성 간의 상충 관계를 해결한다.
  • 스택드 LSTMs의 한계를 극복한다. 이는 지연 시간, 파라미터 수 증가 및 과적합 위험 증가를 수반한다.
  • 압축형 고성능 LSTM을 위한 최적의 네트워크 아키텍처와 가중치를 동시에 학습할 수 있는 방법을 개발한다.
  • 모바일 및 임베디드 시스템과 같은 자원 제약이 있는 장치에 정확한 LSTMs를 구현할 수 있도록 한다.
  • 모델 크기, 추론 속도, 정확도의 세 가지 핵심 지표에서 뛰어난 성능을 달성한다.

제안 방법

  • 셀 내부의 다중 수준 추상화를 가능하게 하기 위해 LSTM 제어 게이트에 다중 은닉층을 통합한 H-LSTM을 제안한다.
  • 기울기 기반 성장과 크기 기반 자르기를 결합한 성장 및 자르기(GP) 학습 프레임워크를 도입하여 가중치와 아키텍처를 동시에 최적화한다.
  • 성장 단계에서는 죽은 ReLU 뉴런을 방지하기 위해 Leaky ReLU를 사용하고, 최종 학습 및 자르기 단계에서는 ReLU로 전환한다.
  • 성장 이후에 크기 기반 자르기를 적용하여 낮은 중요도의 연결을 제거함으로써 높은 희박성(최대 94.22%)을 달성한다.
  • H-LSTM 게이트에서 ReLU 활성화 함수를 활용하여 추론 시 14.5%의 FLOPs 감소를 이끌어내며, 이는 희박한 활성화 패턴 덕분이다.
  • 백프로파게이션을 통해 엔드 투 엔드로 모델을 학습함으로써 네트워크가 최적의 구조와 가중치를 동시에 학습할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1LSTM 제어 게이트에 내부 은닉층을 추가하면 파라미터 수와 추론 지연 시간을 줄이면서도 모델 정확도를 향상시킬 수 있는가?
  • RQ2성장 및 자르기(GP) 학습 전략을 병합하면 H-LSTM의 가중치와 아키텍처를 효과적으로 동시에 학습시킬 수 있는가?
  • RQ3H-LSTM 게이트에서 ReLU를 사용하면 표준 LSTM의 시그모이드/tanh 게이트와 비교해 FLOPs와 지연 시간을 유의미하게 감소시킬 수 있는가?
  • RQ4폭이 줄어든 H-LSTM 모델이라도 표준 스택드 LSTM보다 정확도, 속도, 압축성 측면에서 뛰어난 성능을 낼 수 있는가?
  • RQ5정규화(예: 드롭아웃)는 H-LSTM 모델의 일반화 성능 향상에 어느 정도 기여하는가?

주요 결과

  • MSCOCO에서의 이미지 캡션 생성 작업에서 GP로 학습된 H-LSTM은 파라미터 수를 38.7배 감소시키고 FLOPs를 45.5배 줄였으며, 실행 시간 지연 시간은 4.5배 감소하고 CIDEr 점수는 2.6점 향상되었다.
  • AN4에서의 음성 인식 작업에서 H-LSTM은 파라미터 수를 19.4배 감소시키고 FLOPs를 23.5배 줄였으며, 지연 시간은 15.7% 감소하고 단어 오류율(WER)은 12.9%에서 8.7%로 감소했다.
  • 최종적으로 압축된 H-LSTM 모델은 성장과 자르기의 누적 효과로 94.22%의 희박성을 달성하여 모델 크기를 크게 줄였다.
  • H-LSTM 게이트에서 ReLU를 사용함으로써 평균 활성화 희박성이 48.3%에 도달하여 추론 시 FLOPs가 14.5% 감소했다.
  • 폭이 줄어든 단일층 H-LSTM(기존 512 대비 320)이 정확도, 속도, 압축성의 세 가지 설계 차원에서 표준 LSTM보다 뛰어난 성능을 보였다.
  • 드롭아웃 정규화는 CIDEr 점수를 2.0점 향상시키고 WER를 0.96점 감소시켜 H-LSTM의 일반화에서의 중요성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.