Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Intrinsic Sparse Structures within Long Short-Term Memory

Wei Wen, Yuxiong He|arXiv (Cornell University)|2017. 09. 15.
Topic Modeling참고 문헌 25인용 수 103
한 줄 요약

이 논문은 Intrinsic Sparse Structures(ISS)를 도입하여 LSTM과 RHN 모델의 그룹 희소성을 학습하고 기본 LSTM 구성 요소를 축소하면서도 원래 아키텍처를 유지하여 언어 모델링과 QA 태스크에서 큰 속도 향상과 거의 손실 없는 퍼플렉시티를 달성합니다.

ABSTRACT

Model compression is significant for the wide adoption of Recurrent Neural Networks (RNNs) in both user devices possessing limited resources and business clusters requiring quick responses to large-scale service requests. This work aims to learn structurally-sparse Long Short-Term Memory (LSTM) by reducing the sizes of basic structures within LSTM units, including input updates, gates, hidden states, cell states and outputs. Independently reducing the sizes of basic structures can result in inconsistent dimensions among them, and consequently, end up with invalid LSTM units. To overcome the problem, we propose Intrinsic Sparse Structures (ISS) in LSTMs. Removing a component of ISS will simultaneously decrease the sizes of all basic structures by one and thereby always maintain the dimension consistency. By learning ISS within LSTM units, the obtained LSTMs remain regular while having much smaller basic structures. Based on group Lasso regularization, our method achieves 10.59x speedup without losing any perplexity of a language modeling of Penn TreeBank dataset. It is also successfully evaluated through a compact model with only 2.69M weights for machine Question Answering of SQuAD dataset. Our approach is successfully extended to non- LSTM RNNs, like Recurrent Highway Networks (RHNs). Our source code is publicly available at https://github.com/wenwei202/iss-rnns

연구 동기 및 목표

  • RNN의 모델 압축을 촉진하고 디바이스와 서비스에서 효율적인 추론을 가능하게 한다.
  • Intrinsic Sparse Structures(ISS)를 정의하여 차원 일관성을 유지하면서 기본 LSTM 구성 요소를 축소한다.
  • 그룹 Lasso 기반 학습 방법을 개발하여 학습 또는 파인튜닝 중 ISS 가중치 그룹을 제거한다.
  • LSTMs와 RHNs를 사용한 언어 모델링(Penn TreeBank)과 기계 독해(SQuAD)에서의 효과를 입증한다.
  • ISS의 RHNs 및 기타 RNN 변형으로의 확장성을 보인다.

제안 방법

  • 여덟 개의 LSTM 가중치 행렬을 각 ISS 구성 요소의 좌/우 연결에 대응하는 ISS 가중치 그룹으로 조직한다.
  • 손실에 그룹 Lasso 정규화 항 R(w)=sum over ISS groups of ||w_k^(n)||_2를 추가하여 그룹 희소성을 유도한다(식(2)).
  • 정규화 그라디언트에 비례하는 항으로 ISS 가중치를 SGD로 업데이트한다(식(3)).
  • 미니배치당 작은 가중치를 임계값 tau 아래에서 임계 처리하여 희소성을 안정화한다(식(4)).
  • 연결된 계층에서 차원 일관성을 유지하고 잘못된 LSTM 구조를 피하기 위해 전체 구성 요소(행/열)를 가지치도록 ISS를 허용한다.
  • ISS 학습을 처음부터 또는 파인튜닝으로 확장하고 RHN 및 BiDAF 기반 QA 모델에 적용한다.

실험 결과

연구 질문

  • RQ1LSTMs 내의 고유한 희소 구조를 학습하여 입력 업데이트, 게이트, 은닉 상태, 셀 상태 및 출력의 크기를 차원 일관성을 깨지 않고 감소시킬 수 있는가?
  • RQ2그룹 Lasso 기반의 ISS 희소성 학습이 태스크 성능을 유지하거나 최소한으로 손상시키면서 의미 있는 속도 및 메모리 감소를 가져오는가?
  • RQ3RHN 및 BiDAF와 같은 최신 QA 모델에 대해 ISS가 압축과 정확도 측면에서 얼마나 잘 작동하는가?
  • RQ4희소성 수준, perplexity/EM-F1 점수, 추론 속도 간의 트레이드오프가 언어 및 태스크에 따라 어떻게 나타나는가?

주요 결과

  • ISS 학습은 Penn TreeBank에서 1st 레이어의 크기를 1500에서 373으로, 2nd 레이어를 315으로 축소하면서도 perplexity를 유지하고 추론 속도에서 10.59x의 향상을 달성한다.
  • 컴팩트한 25.2M 파라미터 설계가(대비 66.0M 베이스라인)도 성능을 유지하며 7.10x의 속도향상을 보이고, 더 작은 LSTMs를 직접 설계하는 경우 ISS에서 학습된 큰 모델에 비해 성능이 떨어진다.
  • RHN 실험에서 폭이 830에서 517로 감소하여 11.1M 파라미터를 유지하며 perplexity 손실 없이, 더 감소한 경우에도 경쟁력이 있다; 더 큰 감소는 perplexity를 높인다(최대 74.5/71.2까지).
  • SQuAD 기반 BiDAF에서 ISS 희소성은 여러 LSTM 모듈을 감소시키면서도 EM/F1을 허용 가능한 손실 이내로 유지한다; ISS로 처음부터 학습하면 상당한 압축과 속도 향상을 얻는다(예: 2.69M 베이스라인에서 모듈별로 0.88–2.29M으로 축소).
  • ISS 학습은 처음부터 학습된 단순한 소형 설계보다 성능이 우수할 수 있으며, RNN에서 구조 인지적 희소성의 이점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.