Skip to main content
QUICK REVIEW

[논문 리뷰] Tensorial Neural Networks: Generalization of Neural Networks and Application to Model Compression

Jiahao Su, Jingling Li|arXiv (Cornell University)|2018. 05. 25.
Tensor decomposition and applications참고 문헌 33인용 수 19
한 줄 요약

이 논문은 텐서 연산을 고차원 데이터로 확장하여 다차원 입력 구조를 해체하지 않고 유지하는 텐서형 신경망(TNNs)을 소개한다. 매개변수 학습을 계층적 비선형 텐서 분해로 공식화하고 일반화된 텐서 대수학에서 새로운 역전파 규칙을 유도함으로써, TNNs는 뛰어난 모델 압축 성능을 달성한다. 동일한 압축 비율에서 CIFAR-10에서 최신 저질서 방법보다 5% 높은 정확도를 기록하며, 수개의 주기 동안 수렴 속도가 훨씬 빠르다.

ABSTRACT

We propose tensorial neural networks (TNNs), a generalization of existing neural networks by extending tensor operations on low order operands to those on high order ones. The problem of parameter learning is challenging, as it corresponds to hierarchical nonlinear tensor decomposition. We propose to solve the learning problem using stochastic gradient descent by deriving nontrivial backpropagation rules in generalized tensor algebra we introduce. Our proposed TNNs has three advantages over existing neural networks: (1) TNNs naturally apply to high order input object and thus preserve the multi-dimensional structure in the input, as there is no need to flatten the data. (2) TNNs interpret designs of existing neural network architectures. (3) Mapping a neural network to TNNs with the same expressive power results in a TNN of fewer parameters. TNN based compression of neural network improves existing low-rank approximation based compression methods as TNNs exploit two other types of invariant structures, periodicity and modulation, in addition to the low rankness. Experiments on LeNet-5 (MNIST), ResNet-32 (CIFAR10) and ResNet-50 (ImageNet) demonstrate that our TNN based compression outperforms (5% test accuracy improvement universally on CIFAR10) the state-of-the-art low-rank approximation based compression methods under the same compression rate, besides achieving orders of magnitude faster convergence rates due to the efficiency of TNNs.

연구 동기 및 목표

  • 기존 신경망을 고차원 텐서로 연산을 확장하여 다차원 입력을 해체하지 않고 직접 처리할 수 있도록 일반화한다.
  • 계층적 비선형 텐서 분해를 통해 고차원 텐서 네트워크에서의 매개변수 학습 문제를 해결한다.
  • 일반화된 텐서 대수학 내에서 TNNs의 종단간 훈련을 가능하게 하는 새로운 역전파 프레임워크를 개발한다.
  • 저질서성, 주기성, 변조성 등의 다중 불변 구조를 활용하여 기존의 저질서 방법보다 더 효과적인 모델 압축을 실현한다.
  • 동일한 압축 비율에서 TNN 기반 압축이 최신 압축 기법보다 더 높은 정확도와 더 빠른 수렴 속도를 달성하는가를 입증한다.

제안 방법

  • 고차원 피연산자를 사용하는 텐서 연산을 통해 신경망의 일반화를 제안하여 다차원 입력 데이터를 직접 다룰 수 있도록 한다.
  • 고차원 데이터의 복잡한 상호작용을 포착하기 위해 매개변수 학습 문제를 계층적 비선형 텐서 분해로 공식화한다.
  • 기존에 도입된 일반화된 텐서 대수학 내에서 비트레비알 역전파 규칙을 도출하여 기반 기반 최적화를 지원한다.
  • 저질서성, 주기성, 변조성의 세 가지 불변 구조를 TNN 프레임워크에 통합하여 압축 효율성을 향상시킨다.
  • 표준 아키텍처(LeNet-5, ResNet-32, ResNet-50)에 TNN 기반 압축을 적용하여, 동일한 표현력을 유지하면서도 더 적은 매개변수를 가진 모델로 변환한다.
  • 유도된 역전파 규칙을 기반으로 확률적 경사 하강법을 사용하여 TNNs를 효율적으로 훈련시키며, 구조적 불변성을 활용해 수렴 속도를 높인다.

실험 결과

연구 질문

  • RQ1고차원 텐서 입력에서 해체 없이 직접 작동하는 신경망을 일반화할 수 있는가? 이는 다차원 데이터 구조를 유지하는가?
  • RQ2계층적 비선형 텐서 분해의 복잡성에 비추어 복잡한 고차원 텐서 네트워크에서의 매개변수 학습 문제를 어떻게 공식화하고 해결할 수 있는가?
  • RQ3일반화된 텐서 대수학 내에서 종단간 훈련을 가능하게 하기 위해 어떤 새로운 역전파 규칙이 필요한가?
  • RQ4TNNs는 저질서성, 주기성, 변조성 등의 다중 불변 구조를 얼마나 효과적으로 활용하여 저질서 방법을 초월하는 모델 압축을 실현할 수 있는가?
  • RQ5동일한 압축 비율에서 TNN 기반 압축은 최신 저질서 근사 방법보다 정확도와 수렴 속도 면에서 뛰어나게 성능을 발휘하는가?

주요 결과

  • TNNs는 고차원 텐서에서 직접 작동함으로써 입력 데이터의 다차원 구조를 유지하며, 데이터를 평탄화할 필요가 없다.
  • 동일한 압축 비율에서 CIFAR-10에서 최신 저질서 압축 방법보다 5% 높은 테스트 정확도를 달성한다.
  • TNN 기반 압축은 저질서성, 주기성, 변조성을 포함한 세 가지 불변 구조를 활용하여, 저질서 방법만을 사용할 때보다 더 효과적인 매개변수 감소를 이룬다.
  • 텐서 기반 매개변수화의 효율성 덕분에 TNNs는 표준 압축 네트워크보다 수개의 주기 동안 더 빠르게 수렴한다.
  • 표준 신경망(예: ResNet-32, ResNet-50)을 동일한 표현력을 유지하면서도 훨씬 적은 매개변수를 가진 TNN으로 매핑함으로써 모델의 크기를 크게 줄일 수 있다.
  • LeNet-5(MNIST), ResNet-32(CIFAR-10), ResNet-50(ImageNet)에서의 실험을 통해 다양한 벤치마크에서 일관된 성능 향상과 효율성 향상을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.