Skip to main content
QUICK REVIEW

[논문 리뷰] Compressing Neural Language Models by Sparse Word Representations

Yunchuan Chen, Lili Mou|arXiv (Cornell University)|2016. 10. 13.
Topic Modeling참고 문헌 28인용 수 11
한 줄 요약

이 논문은 희귀어를 빈도가 높은 단어 임베딩의 희소 선형 조합으로 표현하는 압축된 신경망 언어 모델을 제안한다. 이는 어휘 크기에 비례한 파rameter 증가를 극적으로 줄인다. 희소 코드와 NCE 학습을 안정화하는 데 새로운 ZRegression 모듈을 활용함으로써, 표준 언어 모델 대비 낮은 퍼플렉서티와 동시에 최대 80퍼센트의 메모리 절감을 달성하며, 일부 경우에서는 압축되지 않은 기준 모델을 초월하는 성능을 보인다.

ABSTRACT

Neural networks are among the state-of-the-art techniques for language modeling. Existing neural language models typically map discrete words to distributed, dense vector representations. After information processing of the preceding context words by hidden layers, an output layer estimates the probability of the next word. Such approaches are time- and memory-intensive because of the large numbers of parameters for word embeddings and the output layer. In this paper, we propose to compress neural language models by sparse word representations. In the experiments, the number of parameters in our model increases very slowly with the growth of the vocabulary size, which is almost imperceptible. Moreover, our approach not only reduces the parameter space to a large extent, but also improves the performance in terms of the perplexity measure.

연구 동기 및 목표

  • 자신의 메모리 및 파rameter 요구량이 높아 자원이 제한된 환경에서 문제가 되는 표준 신경망 언어 모델의 문제를 해결하기 위해.
  • 어휘 크기가 증가함에 따라 모델 파rameter의 증가를 줄임으로써 파rameter 효율성을 향상시키기 위해.
  • 희귀어는 빈도가 낮아 기울기 업데이트가 흔치 않아 표준 모델에서 잘 튜닝되지 않는 문제를 해결하기 위해 희귀어 표현 학습을 향상시키기 위해.
  • 노이즈 대비 추론(NCE) 학습의 안정성을 높이기 위해 새로운 ZRegression 메커니즘을 도입하여 수렴성과 성능을 향상시키기 위해.
  • 모델의 파rameter를 압축함으로써 모바일 및 임베디드 시스템에 효율적으로 배포할 수 있도록 하기 위해.

제안 방법

  • 희귀어 임베딩을 빈도가 높은 단어 임베딩의 희소 선형 조합(4~8개의 비영성분)으로 표현함으로써 어휘 크기에 따른 파rameter 증가를 줄인다.
  • 사전에 계산된 희소 코딩 체계를 사용하여 희귀어를 일반 단어 벡터의 가중합으로 매핑함으로써, 희소성에 기반해 의미를 유지한다.
  • 출력층 가중치에도 동일한 희소 코딩 전략을 적용하여 예측 서브넷의 압축을 단어 임베딩과 유사하게 수행한다.
  • NCE에서 $ Z_h $의 정규화 요소를 예측하는 데 사용되는 회귀 헤드인 ZRegression을 도입함으로써 학습을 안정화시킨다.
  • 대규모 코퍼스에서 압축된 모델을 위한 엔드 투 엔드 학습을 위해 NCE와 ZRegression을 결합한다.
  • 장기적 문맥을 포착하기 위해 LSTM 기반 순환 인코더를 사용하며, 모든 임베딩과 출력 가중치를 희소 코딩을 통해 압축한다.

실험 결과

연구 질문

  • RQ1희귀어 표현을 빈도가 높은 단어 임베딩의 희소 선형 조합으로 효과적으로 압축할 수 있을까? 성능 손실가능성이 크지 않은가?
  • RQ2희소 코딩을 통한 파rameter 압축이 어휘 크기에 비례해 선형 이하로 증가하는 메모리 소비를 초래할 수 있는가?
  • RQ3제안된 ZRegression 메커니즘이 표준 NCE 대비 NCE 학습을 안정화시키고 성능을 향상시킬 수 있는가?
  • RQ4압축된 모델이 압축되지 않은 기준 모델보다 낮은 퍼플렉서티를 달성할 수 있는가? 특히 희귀어에 대해 더 나은 성능을 보일 수 있는가?
  • RQ5압축된 모델가 대규모 어휘 크기에 대해 얼마나 확장 가능할 수 있으며, 성능을 유지하거나 향상시킬 수 있는가?

주요 결과

  • 압축된 모델은 압축되지 않은 LSTM-z 모델 대비 최대 80퍼센트의 메모리 소비 감소를 기록하며, 어휘 크기가 증가함에 따라 파rameter 수가 거의 증가하지 않는다.
  • LSTM-z,w 및 LSTM-z,wb 모델은 모든 어휘 크기에서 기준 모델인 LSTM-z를 능가하며, 5만 어휘 테스트 세트에서 LSTM-z,w는 79.75의 퍼플렉서티를 기록한다.
  • 매우 적은 파rameter로도 기준 모델보다 낮은 퍼플렉서티를 달성함으로써 일반화 능력 향상과 더불어 희귀어 모델링의 개선이 이루어졌음을 시사한다.
  • ZRegression은 NCE 학습 과정을 안정화시켜 발산을 방지하고, 특히 후반기 학습 단계에서 손실 진동을 감소시킨다.
  • 4~8개의 비영성분을 갖는 희소 코딩은 의미를 잘 유지하며, 성능 향상과 안정된 학습을 통해 그 타당성이 입증된다.
  • 어휘 크기에 비례해 거의 일정한 파rameter 증가를 보임으로써, 이 방법은 자원이 제한된 장치에 대규모 언어 모델을 구동할 수 있도록 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.