Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Learning of Tensor Network Structures

Meraj Hashemizadeh, Meilin Liu|arXiv (Cornell University)|2020. 08. 12.
Tensor decomposition and applications참고 문헌 46인용 수 6
한 줄 요약

이 논문은 데이터로부터 텐서 네트워크(TN) 구조와 파라미터를 동시에 학습하기 위한 근사적 적응형 알고리즘을 제안한다. 이 알고리즘은 랭크-1 텐서에서 시작하여, 랭크 증가를 위한 가장 유망한 엣지를 단계적으로 추가한다. 이는 텐서 분해 및 모델 압축 과제에서 최신 기술을 능가하며, 특히 이미지 복원 및 신경망 압축 과제에서 더 적은 파라미터로 낮은 복원 오차를 달성한다. 또한 진화적 접근보다 훨씬 빠른 속도를 제공한다.

ABSTRACT

Tensor Networks (TN) offer a powerful framework to efficiently represent very high-dimensional objects. TN have recently shown their potential for machine learning applications and offer a unifying view of common tensor decomposition models such as Tucker, tensor train (TT) and tensor ring (TR). However, identifying the best tensor network structure from data for a given task is challenging. In this work, we leverage the TN formalism to develop a generic and efficient adaptive algorithm to jointly learn the structure and the parameters of a TN from data. Our method is based on a simple greedy approach starting from a rank one tensor and successively identifying the most promising tensor network edges for small rank increments. Our algorithm can adaptively identify TN structures with small number of parameters that effectively optimize any differentiable objective function. Experiments on tensor decomposition, tensor completion and model compression tasks demonstrate the effectiveness of the proposed algorithm. In particular, our method outperforms the state-of-the-art evolutionary topology search [Li and Sun, 2020] for tensor decomposition of images (while being orders of magnitude faster) and finds efficient tensor network structures to compress neural networks outperforming popular TT based approaches [Novikov et al., 2015].

연구 동기 및 목표

  • 주어진 머신러닝 과제에 대해 데이터로부터 최적의 텐서 네트워크 구조를 선택하는 문제에 대응하기 위해.
  • 파라미터 예산 내에서 미분 가능한 손실 함수를 최소화할 수 있도록 TN 구조와 파라미터를 동시에 최적화하기 위해.
  • 특정 분해 모델(예: Tucker, TT, TR 등)에 종속되지 않는 일반적이고 효율적이며 적응적인 방법을 개발하기 위해.
  • 임의의 텐서 네트워크 구조 및 비균일 랭크의 공간을 탐색하여 성능 향상을 도모하기 위해.
  • 구조 학습을 통해 효과적인 텐서 분해, 완성 및 신경망 압축을 가능하게 하기 위해.

제안 방법

  • 알고리즘은 랭크-1 텐서에서 시작하여, 손실 감소 기반으로 랭크 증가에 가장 기여할 만한 엣지를 근사적으로 선택하는 전략을 사용한다.
  • 각 단계에서, 현재 TN 구조에 대해 연속 최적화(예: ALS를 통한)를 수행하여 파라미터를 갱신한다.
  • 근사 선택은 미분 가능한 목적 함수에 의해 유도되며, 이는 구조와 파라미터의 엔드 투 엔드 최적화를 가능하게 한다.
  • 이 알고리즘은 다양한 과제에 적용된다: 텐서 분해, 텐서 완성, 신경망 모델 압축.
  • 각 근사 단계에서 이전의 구조를 기반으로 파라미터를 초기화하기 위해 가중치 전이 메커니즘이 사용된다. 이는 수렴 속도를 향상시킨다.
  • 이 방법은 이중 최적화로 제안된다: 이산적 구조 탐색(상위 레벨)과 연속적 파라미터 최적화(하위 레벨).

실험 결과

연구 질문

  • RQ1근사 알고리즘이 다양한 텐서 학습 과제에 대해 최적의 텐서 네트워크 구조를 효과적으로 발견할 수 있는가?
  • RQ2고정된 구조 기반 방법(예: TT, TR, 또는 Tucker)과 비교할 때, 적응적 구조 학습은 파라미터 효율성과 정확도 측면에서 어떻게 성능을 내는가?
  • RQ3이러한 제안된 방법은 텐서 분해 과제에서 진화적 위상 탐색 방법보다 빠르고 성능이 뛰어나게 작용할 수 있는가?
  • RQ4근사 단계 동안의 가중치 전이가 수렴 속도와 최종 성능 향상에 얼마나 기여하는가?
  • RQ5이 방법은 표준 TT 기반 접근 방식을 초월하여 깊은 신경망 압축을 위한 효율적인 TN 구조를 발견할 수 있는가?

주요 결과

  • 제안된 Greedy-TN 알고리즘은 [18]의 최신 기술 진화적 위상 탐색 방법보다 이미지 텐서 분해 과제에서 유의미하게 뛰어나며, 더 적은 파라미터로 낮은 복원 오차를 달성하고, 훈련 속도는 수 개의 지수 차수 빠르다.
  • Einstein 이미지 복원 과제에서, Greedy-TN은 CP, Tucker, TT, TR 기반 베이스라인보다 낮은 상대적 테스트 오차를 기록하며, 더 적은 파라미터를 사용한다.
  • 신경망의 완전 연결 층 압축 과제에서, Greedy-TN은 [22]의 TT 기반 방법보다 더 효율적인 텐서 네트워크 구조를 발견하여, 정확도 저하를 최소화하면서 더 좋은 모델 압축 성능을 달성한다.
  • 다양한 실험에서 가중치 전이 메커니즘이 각 근사 단계에서 랜덤 초기화보다 수렴 속도가 빠르고 복원 오차가 낮다는 것이 입증되었다.
  • 이 방법은 균일 랭크 기반 베이스라인보다 데이터에 더 적합한 비균일 랭크 구조를 효과적으로 발견함으로써, 데이터 기반의 구조 탐색에 대한 적응성을 입증한다.
  • 이 알고리즘은 텐서 분해, 완성, 모델 압축 등 다양한 과제에서 효과적이며, 이는 그 일반성과 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.