Skip to main content
QUICK REVIEW

[논문 리뷰] Tensor Regression Networks with various Low-Rank Tensor Approximations

Xingwei Cao, Guillaume Rabusseau|arXiv (Cornell University)|2017. 12. 27.
Tensor decomposition and applications참고 문헌 14인용 수 17
한 줄 요약

이 논문은 저랭크 텐서 근사값—CP, Tucker, 및 텐서 트레인(TT)—을 사용하여 딥 네ural 네트워크를 압축하면서 성능을 유지하는 텐서 회귀 네트워크(TRN)를 제안한다. TT 분해를 사용한 TRN는 CIFAR-10에서 32층의 ResNet에 대해 54배의 압축률을 달성하며 정확도 저하가 0.3% 미만임을 입증한다. 놀랍게도, 깊은 네트워크에서는 전역 평균 풀링(GAP)이 TRN을 능가하지만, 제한된 데이터로 학습하는 浅층 네트워크에서는 드롭아웃을 적용한 TRN이 뛰어난 성능을 보인다.

ABSTRACT

Tensor regression networks achieve high compression rate of neural networks while having slight impact on performances. They do so by imposing low tensor rank structure on the weight matrices of fully connected layers. In recent years, tensor regression networks have been investigated from the perspective of their compressive power, however, the regularization effect of enforcing low-rank tensor structure has not been investigated enough. We study tensor regression networks using various low-rank tensor approximations, aiming to compare the compressive and regularization power of different low-rank constraints. We evaluate the compressive and regularization performances of the proposed model with both deep and shallow convolutional neural networks. The outcome of our experiment suggests the superiority of Global Average Pooling Layer over Tensor Regression Layer when applied to deep convolutional neural network with CIFAR-10 dataset. On the contrary, shallow convolutional neural networks with tensor regression layer and dropout achieved lower test error than both Global Average Pooling and fully-connected layer with dropout function when trained with a small number of samples.

연구 동기 및 목표

  • 저랭크 텐서 근사값이 신경망에서 가지는 정규화 및 압축 능력을 조사한다.
  • CP, Tucker, 및 텐서 트레인(TT) 분해를 사용한 텐서 회귀 레이어(TRL)의 성능을 비교한다.
  • 얕은 컨볼루션 네트워크를 사용하여 데이터가 적은 환경에서 TRL이 정규화 기법으로서의 효과를 평가한다.
  • TRL이 압축 및 일반화 능력에서 표준 레이어인 전역 평균 풀링(GAP) 및 완전 연결 레이어를 능가할 수 있는지 판단한다.
  • 텐서 랭크 파라미터가 TRL 기반 모델의 표현력과 성능에 미치는 영향을 분석한다.

제안 방법

  • CNN의 최종 완전 연결 레이어와 평탄화 연산을 저랭크 구조를 강제하는 가중치 텐서를 가진 텐서 회귀 레이어(TRL)로 대체한다.
  • 가중치 텐서를 매개변수화하기 위해 세 가지 저랭크 텐서 분해 형식—CP, Tucker, 및 텐서 트레인(TT)—을 적용한다.
  • 텐서 대수학과 다중선형 회귀 원리를 사용하여 각 TRL 변종의 학습 절차를 유도한다.
  • 조기 정지, 드롭아웃(비율 0.3, 0.5, 0.7), L2 정규화(계수 0.01, 0.001, 0.0001)를 사용하여 정규화 효과를 평가한다.
  • MNIST에 대해서는 두 개의 컨볼루션 레이어, CIFAR-10 및 SVHN에 대해서는 세 개의 컨볼루션 레이어를 사용한 표준 CNN 아키텍처를 사용하며, 마지막 컨볼루션 레이어 뒤에 드롭아웃을 적용한다.
  • 다양한 훈련 세트 크기(100~15,000개 샘플)에서 모델 성능을 비교하여 데이터 부족 조건에서의 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1CP, Tucker, TT와 같은 다양한 저랭크 텐서 근사값은 모델 압축 및 일반화 성능 측면에서 어떻게 비교되는가?
  • RQ2완전 연결 레이어에 저랭크 텐서 구조를 강제하면 데이터가 적은 환경에서 효과적인 정규화 기법이 되는가?
  • RQ3깊은 네트워크와 얕은 네트워크에서 TRL의 성능은 전역 평균 풀링(GAP) 및 드롭아웃을 적용한 완전 연결 레이어와 비교해 볼 때 어떻게 되는가?
  • RQ4텐서 랭크 파라미터는 TRL 기반 모델의 표현력과 성능에 어떤 영향을 미치는가?
  • RQ5TRL은 CIFAR-10 및 MNIST와 같은 표준 벤치마크에서 정확도 저하 없이 높은 압축률을 달성할 수 있는가?

주요 결과

  • TRL에서 텐서 트레인(TT) 분해를 사용하면 32층의 ResNet에서 CIFAR-10에서 54배의 압축률을 달성하며 정확도 저하가 0.3% 미만이다.
  • 깊은 네트워크에서 전역 평균 풀링(GAP)이 TRN을 능가하며, TT나 Tucker 분해를 사용한 TRN보다 더 높은 정확도와 압축률을 달성한다.
  • 작은 데이터셋(예: 100~2,000개 샘플)에서 훈련된 얕은 컨볼루션 네트워크에서는 드롭아웃을 적용한 TRL이 GAP 및 드롭아웃을 적용한 완전 연결 레이어보다 더 낮은 테스트 오차를 기록한다.
  • 드롭아웃을 적용한 Tucker- 및 TT-TRL은 데이터가 적은 환경에서 완전 연결 레이어에 드롭아웃을 적용한 것보다 더 높은 테스트 정확도를 기록하여 강력한 정규화 효과를 보여준다.
  • CP, Tucker, TT 분해를 사용한 TRL의 성능은 MNIST 및 CIFAR-10에서 유사했으며, 다양한 형식 간에 유의미한 정확도 차이가 관찰되지 않았다.
  • GAP는 특정 랭크 제약 조건 하에서 TRL의 특수한 경우로, Tucker 분해를 사용할 때의 등가성을 이론적으로 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.