Skip to main content
QUICK REVIEW

[논문 리뷰] BT-Nets: Simplifying Deep Neural Networks via Block Term Decomposition

Guangxi Li, Jinmian Ye|arXiv (Cornell University)|2017. 12. 15.
Tensor decomposition and applications참고 문헌 27인용 수 12
한 줄 요약

이 논문은 블록 텀(Blcok Term, BT) 분해를 사용하여 완전 연결(FC) 레이어를 대체하는 새로운 딥 네ural 네트워크 아키텍처인 BT-Nets를 제안한다. 이를 통해 파rameter를 극적으로 감소시킨다. 입력/출력을 저질서 텐서로 재형태화하고 BT 분해를 적용함으로써, BT-Nets는 이미지넷에서 정확도 손실을 최소화하면서도 11,000배 이상의 압축 비율을 달성한다. 이는 피니어 튜닝 없이도 텐서 트레인(TT) 방법을 뛰어넘는 압축 성능과 정확도 유지 성능을 제공한다.

ABSTRACT

Recently, deep neural networks (DNNs) have been regarded as the state-of-the-art classification methods in a wide range of applications, especially in image classification. Despite the success, the huge number of parameters blocks its deployment to situations with light computing resources. Researchers resort to the redundancy in the weights of DNNs and attempt to find how fewer parameters can be chosen while preserving the accuracy at the same time. Although several promising results have been shown along this research line, most existing methods either fail to significantly compress a well-trained deep network or require a heavy fine-tuning process for the compressed network to regain the original performance. In this paper, we propose the extit{Block Term} networks (BT-nets) in which the commonly used fully-connected layers (FC-layers) are replaced with block term layers (BT-layers). In BT-layers, the inputs and the outputs are reshaped into two low-dimensional high-order tensors, then block-term decomposition is applied as tensor operators to connect them. We conduct extensive experiments on benchmark datasets to demonstrate that BT-layers can achieve a very large compression ratio on the number of parameters while preserving the representation power of the original FC-layers as much as possible. Specifically, we can get a higher performance while requiring fewer parameters compared with the tensor train method.

연구 동기 및 목표

  • 깊은 신경망(DNN)의 큰 파라미터 수로 인해 자원이 제한된 장치에 배포하는 데 도전하는 문제를 해결하기 위해.
  • 기존의 텐서 트레인(TT)과 같은 방법보다 높은 압축 비율을 달성할 수 있는지, 텐서 분해가 표현 능력을 유지할 수 있는지 탐색하기 위해.
  • 순위 변화에 대한 내재된 강건성을 지닌 레이어 아키텍처를 설계하여 피니어 튜닝이 필요 없도록 하기 위해.
  • 완전 연결 레이어의 파라미터 수를 극적으로 감소시키면서도 정확도를 유지하거나 향상시킬 수 있는지 보여주기 위해.

제안 방법

  • 기본 완전 연결(FC) 레이어를 블록 텀(BT) 레이어로 대체하여, 가중치 행렬을 텐서로 표현하는 데 블록 텀 분해를 사용한다.
  • BT 분해를 적용하기 전에 입력 및 출력 활성화를 저차원 고차원 텐서로 재형태화한다.
  • 복잡성과 표현 능력의 제어를 위해 두 가지 유형의 랭크—CP-랭크(R_C)와 터커-랭크(R_T)—를 사용한다.
  • 블록 텀 분해를 터커와 CANDECOMP/PARAFAC 분해를 조합하는 텐서 연산자로 적용함으로써 기하급수적인 표현 능력을 가능하게 한다.
  • BT 레이어의 교환 법칙을 활용하여, TT 레이어가 순위 최적화가 필요로 하는 것과 달리 순위의 피니어 튜닝이 필요 없도록 한다.
  • 추가적인 피니어 튜닝 없이도 엔드 투 엔드로 네트워크를 훈련시키며, BT 분해의 구조적 강건성을 활용한다.

실험 결과

연구 질문

  • RQ1블록 텀 분해가 기존의 텐서 트레인(TT)과 같은 텐서 분해 방법보다 완전 연결 레이어에서 훨씬 높은 압축 비율을 달성할 수 있는가?
  • RQ2매우 큰 파라미터 감소에도 불구하고 BT 레이어가 표준 FC 레이어의 표현 능력을 유지하거나 향상시키는가?
  • RQ3TT 기반 네트워크가 민감한 순위 설정을 요구하는 것과 달리, BT-Nets는 피니어 튜닝 없이도 높은 압축을 달성할 수 있는가?
  • RQ4CP-랭크와 터커-랭크가 BT 레이어의 정확도와 파라미터 수에 공동으로 영향을 미치는 방식은 어떠한가?
  • RQ5기본 FC 및 TT 레이어와 비교할 때 BT-Nets의 압축, 정확도, 추론/훈련 시간 간의 상충 관계는 어떠한가?

주요 결과

  • 이미지넷에서 최적의 BT 레이어 구성('4-BT2')은 단일 FC 레이어에서 6400×4096에서 2,368개 파라미터로 감소시켜 11,070배의 압축 비율을 달성했으며, TT8(2,528 압축 비율)를 뛰어넘었다.
  • '4-BT2' 구성은 Top-1 정확도 56.48%와 Top-5 정확도 79.69%를 기록했으며, 피니어 튜닝 없이도 기준 모델(56.17% Top-1, 79.62% Top-5)보다 略적으로 높았다.
  • '1-BT2' 구성은 44,000배 이상의 압축 요소를 달성했고 Top-5 정확도 손실이 2.2%에 불과했으며, 압축과 정확도 양면에서 'TT2'를 뛰어넘었다.
  • 낮은 랭크일 경우 BT 레이어는 뚜렷한 추론 속도 향상을 보였고, 랭크를 기준 성능에 맞게 증가시킬 경우에만 훈련 및 추론 시간이 FC 레이어 수준에 도달했다.
  • 실험 결과 CP-랭크와 터커-랭크를 증가시키면 정확도가 향상되었지만, 특정 값 이상에서는 수익 감소 현상이 나타났고, 과도한 랭크는 코어 텐서의 기하급수적 확장으로 인해 파라미터 수가 급격히 증가하는 결과를 초래했다.
  • BT 레이어의 교환 법칙적 구조는 TT 레이어가 순위 조정이 민감한 '올리브 모양'의 순위 분포를 가지는 것과 달리 피니어 튜닝이 필요 없음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.