Skip to main content
QUICK REVIEW

[논문 리뷰] StrassenNets: Deep Learning with a Multiplication Budget

Michael Tschannen, Aran Khanna|arXiv (Cornell University)|2017. 12. 11.
Advanced Neural Network Applications참고 문헌 40인용 수 11
한 줄 요약

이 논문은 딥 뉴럴 네트워크의 행렬 곱셈을 스트라센 알고리즘과 유사한 학습 가능한 저곱셈 산술 회로로 대체하는 StrassenNets 프레임워크를 제안한다. 이는 곱셈 수에 엄격한 예산을 두고도 엔드 투 엔드 학습이 가능하게 하며, 공동 최적화와 지식 정복을 통해 전체 정밀도 모델 정확도를 유지하면서 곱셈 수를 99.5% 이상 감소시킨다. 또한 2×2 행렬 곱셈을 8번이 아닌 7번의 곱셈으로 수행하는 스트라센 알고리즘을 재발견한다.

ABSTRACT

A large fraction of the arithmetic operations required to evaluate deep neural networks (DNNs) consists of matrix multiplications, in both convolution and fully connected layers. We perform end-to-end learning of low-cost approximations of matrix multiplications in DNN layers by casting matrix multiplications as 2-layer sum-product networks (SPNs) (arithmetic circuits) and learning their (ternary) edge weights from data. The SPNs disentangle multiplication and addition operations and enable us to impose a budget on the number of multiplication operations. Combining our method with knowledge distillation and applying it to image classification DNNs (trained on ImageNet) and language modeling DNNs (using LSTMs), we obtain a first-of-a-kind reduction in number of multiplications (over 99.5%) while maintaining the predictive performance of the full-precision models. Finally, we demonstrate that the proposed framework is able to rediscover Strassen's matrix multiplication algorithm, learning to multiply $2 imes 2$ matrices using only 7 multiplications instead of 8.

연구 동기 및 목표

  • 자원 제약이 있는 하드웨어에 효율적으로 구현하기 위해 딥 뉴럴 네트워크(DNNs)의 곱셈 수를 줄이는 것.
  • 곱셈 예산을 설정하여 산술 복잡도와 모델 정확도 사이의 미세 조절 가능한 트레이드오프를 가능하게 하는 것.
  • 스트라센이나 윈오그라드와 같은 수작업으로 설계된 알고리즘에 의존하지 않고, 데이터로부터 엔드 투 엔드로 근사 행렬 곱셈 변환을 학습하는 것.
  • 곱셈 수가 극적으로 감소함에도 불구하고 전체 정밀도 모델의 예측 성능을 유지하는 것.
  • 이 프레임워크가 기존의 빠른 알고리즘, 예를 들어 2×2 행렬 곱셈을 위한 스트라센 알고리즘을 재발견할 수 있는지 보여주는 것.

제안 방법

  • DNN 레이어의 행렬 곱셈을 2층 구조의 합-곱 네트워크(SPNe)로 재구성하여 곱셈과 덧셈 연산을 분리하는 것.
  • SPN 간선 가중치를 {−1, 0, 1}에 속하는 삼항 행렬로 표현하여, 비제로 가중치의 수를 통해 곱셈 수에 명시적인 제어를 가능하게 하는 것.
  • 데이터 기반 학습을 통해 SPN 가중치와 네트워크 파라미터를 함께 최적화하기 위해 엔드 투 엔드 확률적 경사 하강법을 수행하는 것.
  • 전체 정밀도 교사 모델에서 압축된 학생 모델로 지식을 전이하기 위해 지식 정복을 적용하여 정확도 저하를 최소화하는 것.
  • 컨볼루션 및 순환 레이어, 특히 ResNets와 LSTM 기반 언어 모델에 대해, 컨볼루션과 완전 연결 레이어를 SPN 기반 변환으로 재구성함으로써 프레임워크를 적용하는 것.
  • SPN의 은닉 유닛 수(r)를 제어 파rameter로 사용하며, r을 출력 채널 수 또는 은닉 유닛 수로 설정함으로써 곱셈 예산을 제어하는 파arameterization 전략을 사용하는 것.

실험 결과

연구 질문

  • RQ1수작업으로 설계된 알고리즘(예: 스트라센 또는 윈오그라드)보다 학습 가능한, 미분 가능한 프레임워크가 DNN의 곱셈 수를 더 효과적으로 줄일 수 있는가?
  • RQ2SPN 기반 변환의 엔드 투 엔드 학습을 통해 곱셈 수를 99% 이상 감소시키되, 모델 정확도를 유지할 수 있는가?
  • RQ3지식 정복을 통해 곱셈 수가 극적으로 감소한 모델의 예측 성능을 복원할 수 있는가?
  • RQ4이 프레임워크는 2×2 행렬 곱셈을 8번이 아닌 7번의 곱셈으로 수행하는 알려진 빠른 알고리즘인 스트라센 알고리즘을 재발견할 수 있는가?
  • RQ5기존의 양자화 및 압축 기법과 비교했을 때, 제안된 방법은 곱셈 수 감소와 정확도 측면에서 어떤가?

주요 결과

  • ImageNet에서 ResNet-18에 대해 StrassenNets는 곱셈 수를 99.63% 감소시켰고, 전체 정밀도 모델 대비 상위 1위 정확도가 2.0% 감소하는 데 그쳤다.
  • 언어 모델링에서는 PTB 데이터셋에서 곱셈 수를 99.69% 감소시켰고, 퍼플렉서티는 3.3% 증가에 그쳤다.
  • 지식 정복을 적용한 결과, 이미지 분류 및 언어 모델링 모두에서 전체 정밀도 모델의 예측 성능을 유지하면서 곱셈 수를 99.5% 이상 감소시켰다.
  • 압축된 모델에서 지식 정복을 통해 학습된 StrassenNets는 언어 모델링 환경에서 r ≥ n_out일 경우 교사 모델을 초월하는 성능을 보였으며, 이는 지식 정복이 압축 모델의 성능을 향상시킨다는 것을 시사한다.
  • 프레임워크는 스트라센의 2×2 행렬 곱셈 알고리즘을 성공적으로 재발견하여, 8번이 아닌 7번의 곱셈으로 2×2 행렬을 곱하는 것을 학습했다.
  • 유사한 곱셈 수를 가진 비교 가능한 TWN 양자화 기반 베이스라인보다 7.4% 낮은 퍼플렉서티를 달성하여, 더 뛰어난 효율-정확도 트레이드오프를 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.