QUICK REVIEW
[논문 리뷰] Factorization tricks for LSTM networks
Oleksii Kuchaiev, Boris Ginsburg|arXiv (Cornell University)|2017. 03. 31.
Neural Networks and Applications참고 문헌 13인용 수 88
한 줄 요약
이 논문은 인자화된 LSTM(F-LSTM)과 그룹 LSTM(G-LSTM)을 도입하여 매개변수 수를 줄이고 학습 속도를 높이며, One Billion Word Benchmark에서 거의 최상위 수준의 perplexity를 달성하되 RNN 매개변수 수를 줄임.
ABSTRACT
We present two simple ways of reducing the number of parameters and accelerating the training of large Long Short-Term Memory (LSTM) networks: the first one is "matrix factorization by design" of LSTM matrix into the product of two smaller matrices, and the second one is partitioning of LSTM matrix, its inputs and states into the independent groups. Both approaches allow us to train large LSTM networks significantly faster to the near state-of the art perplexity while using significantly less RNN parameters.
연구 동기 및 목표
- 대형 언어 모델에서 LSTM 매개변수 수와 학습 시간을 줄이려는 동기를 제시한다.
- 계산 및 메모리 요구를 낮추기 위해 LSTMP의 분해와 그룹화를 제안한다.
- 대규모 언어 모델링 작업에서 방법을 평가하고 강력한 기준선과 비교한다.
- 성능을 유지하면서 학습 효율성을 향상시키는 시기와 방법에 대한 지침을 제공한다.
제안 방법
- Factorized LSTM (F-LSTM)은 4n x 2p 선형 변환을 W2*W1의 두 개의 작은 행렬 곱으로 대체하며, 여기서 W1의 크기는 2p x r이고 W2의 크기는 r x 4n이며 계수(rank) r < p를 사용한다.
- Group LSTM (G-LSTM)은 입력 x와 은닉 상태 h를 독립적인 그룹으로 분할하고, 각 그룹은 R^{2p/k}에서 R^{4n/k}로의 자체 선형 변환을 계산한다.
- 두 방법 모두 원래의 LSTMP에 비해 매개변수 수를 줄이며; F-LSTM은 매개변수를 (r*2p + r*4n)로 줄이고 (2p*4n) 대비; G-LSTM은 그룹 간 계산을 분산시켜 모델 병렬화를 가능하게 한다.
- 연구는 프로젝션 크기가 p인 LSTMP를 사용하고 One Billion Word Benchmark에서 언어 모델링을 테스트한다.
- 저자들은 임베딩 크기와 소프트맥스 크기를 제어하는 데 프로젝션 크기가 결정적이라고 지적한다.
실험 결과
연구 질문
- RQ1LSTM 가중치 행렬의 분해가 매개변수 수를 줄이고 학습 속도를 높이면서 성능을 유지할 수 있는가?
- RQ2독립적인 그룹으로 LSTM을 분할(G-LSTM)하여 더 적은 매개변수로 유사하거나 더 나은 효율성을 제공할 수 있는가?
- RQ3F-LSTM과 G-LSTM가 perplexity와 One Billion Word Benchmark에서의 학습 처리율에서 기본 BIGLSTM과 어떻게 비교되는가?
- RQ4그룹 수나 인자(rank) 분해에 따라 모델 크기, 속도(words/sec), perplexity 간의 트레이드오프는 무엇인가?
주요 결과
- 2그룹의 G-LSTM은 기본선에 가까운 perplexity를 달성하면서도 매개변수 수가 크게 줄고 학습 속도가 빠르다.
- 중간 계수(rank) F512를 가진 F-LSTM은 BIGLSTM보다 더 빨리 학습하고 매개변수도 적게 사용하며 경쟁력 있는 perplexity를 달성한다.
- 그룹 수를 늘리면 (G-4, G-8) 매개변수 수가 더 줄어들지만 perplexity가 증가할 수 있다; G-8은 850.4k 매개변수로 39.4 perplexity를 얻는다.
- 분해 기반 및 그룹 기반 LSTM은 동일한 실제 시간 예산 내에서 훨씬 빠르게 학습하여 거의 최첨단 perplexity에 도달한다.
- 계층적 그룹 구성을 가진(G4-G8 등)은 정확도 손실 없이 효율성을 개선할 가능성을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.