Skip to main content
QUICK REVIEW

[논문 리뷰] ExpandNets: Linear Over-parameterization to Train Compact Convolutional Networks

Shuxuan Guo, José M. Alvarez|arXiv (Cornell University)|2018. 11. 26.
Advanced Neural Network Applications참고 문헌 66인용 수 9
한 줄 요약

ExpandNets는 비선형성이 없는 연속된 선형 레이어로 각 선형 레이어를 선형적으로 과다 파rameter화함으로써 컴팩트한 합성곱 신경망을 위한 새로운 훈련 방법을 제안한다. 이는 추론 시 원래의 컴팩트한 네트워크로 대수적으로 압축할 수 있게 하여 최적화 및 일반화를 향상시킨다. 이는 이미지 분류, 객체 검출, 세그멘테이션 작업에서 모두 훈련에서부터 시작하는 것과 지식 증류를 능가한다.

ABSTRACT

We introduce an approach to training a given compact network. To this end, we leverage over-parameterization, which typically improves both neural network optimization and generalization. Specifically, we propose to expand each linear layer of the compact network into multiple consecutive linear layers, without adding any nonlinearity. As such, the resulting expanded network, or ExpandNet, can be contracted back to the compact one algebraically at inference. In particular, we introduce two convolutional expansion strategies and demonstrate their benefits on several tasks, including image classification, object detection, and semantic segmentation. As evidenced by our experiments, our approach outperforms both training the compact network from scratch and performing knowledge distillation from a teacher. Furthermore, our linear over-parameterization empirically reduces gradient confusion during training and improves the network generalization.

연구 동기 및 목표

  • 컴팩트한 합성곱 신경망을 효과적으로 처음부터 훈련하는 데 어려움을 해결하기 위해.
  • 선형 과다 파rameter화가 컴팩트한 네트워크에서 훈련 동역학과 일반화를 향상시킬 수 있는지 탐구하기 위해.
  • 성능 손실 없이 확장된 네트워크를 훈련한 후 대수적으로 압축하여 원래의 컴팩트한 네트워크로 복원할 수 있는 방법을 개발하기 위해.
  • 선형 과다 파rameter화가 기울기 혼동을 줄이고 최적화를 향상시킨다는 것을 입증하기 위해.
  • 지식 증류의 실용적이고 즉시 사용 가능한 대안을 제공하기 위해.

제안 방법

  • 컴팩트한 네트워크의 각 선형 레이어를 비선형성이 없는 연속된 다수의 선형 레이어로 확장하기.
  • 세 가지 별도의 확장 전략을 사용하기: (i) k×k 컨벌루션을 1×1, k×k, 1×1 컨벌루션으로 대체하기; (ii) 큰 커널 크기의 컨벌루션(>3×3)을 다수의 3×3 컨벌루션으로 대체하기; (iii) 완전 연결 레이어를 다수의 선형 레이어로 확장하기.
  • 연속된 선형 레이어의 시퀀스를 단일 등가 선형 변환으로 압축하여 확장된 네트워크와 원래 컴팩트한 네트워크 간의 등가성을 유지하기.
  • 컨벌루션의 행렬-벡터 표현을 활용하여 표준 행렬 곱셈을 사용해 확장된 레이어의 등가 가중치 행렬을 계산하기.
  • PyTorch 텐서 연산을 사용해 확장 및 압축을 구현하여 수치적 등가성과 최소한의 계산 오버헤드를 확보하기.
  • 확장된 네트워크(ExpandNet)를 엔드 투 엔드로 훈련한 후 추론을 위해 원래 아키텍처로 다시 압축하기.

실험 결과

연구 질문

  • RQ1컴팩트한 합성곱 신경망에 선형 과다 파arameter화를 적용하면 처음부터 훈련하는 것보다 훈련 성능이 향상되는가?
  • RQ2선형 과다 파arameter화는 컴팩트한 네트워크에서 최적화 과정 중 기울기 혼동을 줄이는가?
  • RQ3컴팩트한 네트워크를 훈련할 때 ExpandNets는 지식 증류를 능가하는가?
  • RQ4확장 전략의 선택(예: 커널 크기 대체)이 컴팩트 모델의 최종 성능에 어떤 영향을 미치는가?
  • RQ5선형 과다 파arameter화는 컴팩트한 네트워크에서 일반화 및 손실 곡면 성질을 어느 정도 향상시키는가?

주요 결과

  • ExpandNets는 이미지 분류, 객체 검출, 세그멘테이션 작업에서 ImageNet, PASCAL VOC, Cityscapes 벤치마크에서 컴팩트한 네트워크를 처음부터 훈련하는 것보다 뛰어난 성능을 보였다.
  • 모든 평가된 작업에서 더 큰 교사 네트워크로부터의 지식 증류보다 우수한 성능을 달성했다.
  • 확장된 네트워크는 훈련 중 더 안정적이고 상관성이 적은 기울기를 보이며 기울기 혼동이 감소한 것으로 나타났다.
  • 선형 과다 파arameter화는 더 평탄한 손실 곡면을 이끌어내어 일반화 성능 향상과 관련이 있었다.
  • 이 방법은 다양한 네트워크 아키텍처와 작업에서 효과적이었으며, 큰 커널을 다수의 3×3 컨벌루션으로 대체하는 커널 크기 확장 전략이 특히 유익했다.
  • 확장된 네트워크의 대수적 압축은 원래 모델의 파라미터와 추론 행동을 수치 오차 1e-5 이내로 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.