Skip to main content
QUICK REVIEW

[논문 리뷰] Tensor Decomposition for Compressing Recurrent Neural Network

Andros Tjandra, Sakriani Sakti|arXiv (Cornell University)|2018. 02. 28.
Tensor decomposition and applications참고 문헌 27인용 수 6
한 줄 요약

이 논문은 성능을 유지하면서 모델 파라미터를 줄이기 위해 텐서 분해 방법—CP, Tucker, 및 텐서 트레인(TT)—을 사용하여 게이트드 리커런트 유닛(GRUs)을 압축하는 것을 제안한다. 동일한 파라미터 수준에서 여러 시퀀스 모델링 작업에서 TT-GRU가 CP-GRU와 Tucker-GRU를 모두 앞서며 특히 다성분 음악 데이터셋에서 뛰어난 성능을 보였다.

ABSTRACT

In the machine learning fields, Recurrent Neural Network (RNN) has become a popular architecture for sequential data modeling. However, behind the impressive performance, RNNs require a large number of parameters for both training and inference. In this paper, we are trying to reduce the number of parameters and maintain the expressive power from RNN simultaneously. We utilize several tensor decompositions method including CANDECOMP/PARAFAC (CP), Tucker decomposition and Tensor Train (TT) to re-parameterize the Gated Recurrent Unit (GRU) RNN. We evaluate all tensor-based RNNs performance on sequence modeling tasks with a various number of parameters. Based on our experiment results, TT-GRU achieved the best results in a various number of parameters compared to other decomposition methods.

연구 동기 및 목표

  • 모델 표현력을 훼손하지 않으면서 순환 신경망(RNNs)의 파라미터 수를 줄이는 것.
  • CP, Tucker, TT와 같은 텐서 분해 방법이 RNN 가중치 행렬을 압축하는 데 효과적인지 평가하는 것.
  • 다양한 파라미터 수에서 CP-GRU, Tucker-GRU, TT-GRU의 성능을 시퀀스 모델링 작업에서 비교하는 것.
  • 자원이 제한된 장치에 효율적으로 구현할 수 있도록 정확도를 유지하면서 최적의 압축 성능을 제공하는 텐서 분해 방법을 규명하는 것.

제안 방법

  • GRU 유닛의 가중치 행렬을 단일 랭크 텐서의 합으로 분해하기 위해 CP 분해를 적용한다.
  • 각 모드에 따라 요소 행렬을 곱한 코어 텐서로 가중치 행렬을 표현하기 위해 Tucker 분해를 사용한다.
  • 연결된 저랭크 텐서의 시퀀스로 가중치 행렬을 표현하기 위해 텐서 트레인(TT) 분해를 구현한다.
  • 각 분해 방법을 사용하여 GRU 모델을 재설계하고, 밀집 가중치 행렬을 압축된 텐서 형식으로 대체한다.
  • 부정적 로그우도(NLL)를 지표로 사용하여 다성분 음악 시퀀스 모델링 작업에서 압축된 모델을 훈련하고 평가한다.
  • 각 분해 방법의 랭크 초모수를 조정하여 모델 간 파라미터 수를 통제한다.

실험 결과

연구 질문

  • RQ1CP, Tucker, TT 분해 방법이 성능을 유지하면서 GRU 모델을 얼마나 효과적으로 압축할 수 있는가?
  • RQ2주어진 파라미터 수에서 어떤 텐서 분해 방법이 시퀀스 모델링 작업에서 가장 낮은 부정적 로그우도(NLL) 점수를 달성하는가?
  • RQ3TT 분해가 압축되지 않은 GRU 및 다른 분해된 변형보다 성능을 유지하거나 향상시킬 수 있는가?
  • RQ4파라미터 제약 조건 하에서 노팅엄, JSB Chorales, PianoMidi, MuseData 등의 다양한 데이터셋에서 모델 성능은 어떻게 변하는가?
  • RQ5각 분해 방법의 경우 RNN 압축에서 파라미터 효율성과 성능 간의 상충 관계는 어떠한가?

주요 결과

  • TT-GRU는 모든 데이터셋에서 가장 낮은 부정적 로그우도(NLL) 점수를 기록했으며, 동일한 파라미터 수에서 CP-GRU와 Tucker-GRU를 모두 앞섰다.
  • PianoMidi 데이터셋에서 TT-GRU는 11,392개의 파라미터로 NLL 7.16을 기록했고, Tucker-GRU(7.20)와 CP-GRU(7.23)보다 뛰어난 성능을 보였다.
  • MuseData 데이터셋에서 TT-GRU는 11,392개의 파라미터로 NLL 7.16을 달성했고, Tucker-GRU는 7.20, CP-GRU는 7.23을 기록했다.
  • 6,000개 이상의 파라미터 수준에서 CP-GRU는 TT-GRU와 유사한 성능을 보였지만, 모든 테스트 설정에서 약간 뒤처졌다.
  • Tucker-GRU는 모든 데이터셋과 파라미터 설정에서 CP-GRU와 TT-GRU보다 일관되게 열등한 성능을 보였다.
  • TT 분해 방법은 높은 모델 표현력을 유지하면서도 상당한 파라미터 감소를 가능하게 하여 이 연구에서 GRU에 대한 가장 효과적인 압축 방법이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.