Skip to main content
QUICK REVIEW

[논문 리뷰] Compressing Recurrent Neural Networks Using Hierarchical Tucker Tensor Decomposition

Miao Yin, Siyu Liao|arXiv (Cornell University)|2020. 05. 09.
Tensor decomposition and applications참고 문헌 20인용 수 21
한 줄 요약

이 논문은 계층적 텐서 분해(Hierarchical Tucker, HT)를 제안하여 순환 신경망(RNN)을 압축함으로써 더 강력한 계층적 표현 학습과 뛰어난 모델 압축을 가능하게 한다. HT-LSTM는 최대 12,945배의 압축 비율을 달성하며, YouTube Faces에서 최대 88.1%, UCF11에서 최대 98.1%의 테스트 정확도를 기록하여 TT-LSTM, TR-LSTM, BT-LSTM와 같은 최신 기법들을 여러 벤치마크에서 능가한다.

ABSTRACT

Recurrent Neural Networks (RNNs) have been widely used in sequence analysis and modeling. However, when processing high-dimensional data, RNNs typically require very large model sizes, thereby bringing a series of deployment challenges. Although the state-of-the-art tensor decomposition approaches can provide good model compression performance, these existing methods are still suffering some inherent limitations, such as restricted representation capability and insufficient model complexity reduction. To overcome these limitations, in this paper we propose to develop compact RNN models using Hierarchical Tucker (HT) decomposition. HT decomposition brings strong hierarchical structure to the decomposed RNN models, which is very useful and important for enhancing the representation capability. Meanwhile, HT decomposition provides higher storage and computational cost reduction than the existing tensor decomposition approaches for RNN compression. Our experimental results show that, compared with the state-of-the-art compressed RNN models, such as TT-LSTM, TR-LSTM and BT-LSTM, our proposed HT-based LSTM (HT-LSTM), consistently achieves simultaneous and significant increases in both compression ratio and test accuracy on different datasets.

연구 동기 및 목표

  • 약한 계층적 구조로 인해 표현 능력이 제한되는 기존 텐서 분해 기법들(TT, TR, BT 등)의 한계를 해결하기 위해.
  • 이전 접근 방식에서 모델 복잡도 감소가 부족한 점을 보완하기 위해, 더 강력한 계층적 모델링과 더 큰 파라미터 및 계산량 절감을 가능하게 하는 분해 방법을 도입하기 위해.
  • 계층적 텐서(HT) 분해를 사용하여 표현 능력을 향상시키면서도 저장 및 계산 비용을 최소화하는 컴act한 RNN 아키텍처를 개발하기 위해.
  • HT 기반 RNN이 다양한 시퀀스 모델링 작업에서 기존 최고 수준의 압축 RNN 모델보다 더 높은 정확도와 압축 비율을 달성할 수 있음을 입증하기 위해.
  • 다양한 영상 및 텍스트 데이터셋에서 엔드 투 엔드 학습 및 사전 학습된 CNN 미세조정 설정 모두에서 HT 분해의 효과성을 검증하기 위해.

제안 방법

  • LSTM 네트워크의 가중치 행렬, 특히 입력-은닉 및 출력-은닉 가중치 텐서에 계층적 텐서(HT) 분해를 적용한다.
  • 원래의 고차원 가중치 텐서를 코어 텐서와 요인 행렬의 조합으로 표현하여 다중 수준의 의존성을 포괄하는 계층적 구조를 형성한다.
  • 각 분해 수준을 반복적으로 적용하여 가중치 텐서의 질량과 차원을 줄이는 다수준 텐서 분해 프레임워크를 사용한다.
  • 표준 backpropagation와 ADAM 옵timizer를 사용하여 HT-LSTM 모델을 최적화하며, 일반화 성능 향상을 위해 L2 정규화와 드롭아웃을 통합한다.
  • 사전 학습된 CNN 설정에서는 Inception-V3를 사용해 압축된 특징(2,048차원)을 추출하고, 이를 4차원 텐서(예: 8×8×8×4)로 재형성한 후 RNN의 가중치 텐서에 HT 분해를 적용한다.
  • 모든 실험에서 모든 HT 분해 노드의 랭크를 4로 설정하여 이전 연구와의 일관된 비교를 확보한다.

실험 결과

연구 질문

  • RQ1계층적 텐서 분해(Hierarchical Tucker)가 기존 텐서 분해 기법들(TT, TR, BT 등)보다 압축된 RNN에서 더 나은 표현 능력을 제공할 수 있는가?
  • RQ2HT 기반 RNN 압축이 기존 최고 수준의 기법들과 비교해 더 높은 모델 압축 비율을 달성하면서도 테스트 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ3표준 영상 및 텍스트 시퀀스 벤치마크에서 HT-LSTM은 TT-LSTM, TR-LSTM, BT-LSTM와 비교해 어떻게 성능을 내는가?
  • RQ4특히 자원이 제한된 환경에서 사전 학습된 CNN을 특징 추출기로 사용할 때 HT-LSTM은 높은 성능을 유지할 수 있는가?
  • RQ5HT 분해의 계층적 구조가 RNN 내 시계열 의존성 모델링에 얼마나 기여하는가?

주요 결과

  • YouTube Faces 데이터셋에서 HT-LSTM은 88.1%의 테스트 정확도를 기록하여 이전 최고 수준의 모델(80.8%)보다 7.3%p 높다.
  • UCF11 데이터셋에서 HT-LSTM은 98.1%의 정확도를 달성했으며, 이는 최고의 이전 결과(94.6%)보다 3.5%p 높고, 동일한 사전 학습된 CNN을 사용한 TR-LSTM보다 4.3%p 높다.
  • UCF11에서 HT-LSTM은 12,945×의 압축 비율을 달성했으며, 동일한 베이직 LSTM을 압축한 TR-LSTM의 25× 압축 비율을 크게 뛰어넘었다.
  • HMDB51 데이터셋에서 HT-LSTM은 64.2%의 정확도를 기록했으며, TR-LSTM(63.8%)을 능가하고 대부분의 이전 방법들을 초월했으며, 광학 흐름 데이터를 사용하지 않아도 된다.
  • HT-LSTM은 RGB 입력만으로도 64.2%의 정확도를 기록했고, 이는 이전 최고 수준의 모델이 RGB만을 사용했을 때의 49.8%보다 높아, 강건성과 효율성을 입증했다.
  • HT 분해의 계층적 구조는 복잡한 시계열 패턴을 더 잘 모델링할 수 있게 하여, 비계층적 방법에 비해 더 뛰어난 일반화 성능과 표현 능력을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.