Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Weight Importance and Hessian Bias in Model Pruning

Mingchen Li, Yahya Sattar|arXiv (Cornell University)|2020. 06. 19.
Adversarial Robustness in Machine Learning참고 문헌 60인용 수 5
한 줄 요약

이 논문은 Hessian 기반, 크기 기반, 자연 중요도라는 세 가지 중요도 기준을 비교함으로써 모델 프루닝에 대한 원칙적인 분석을 제안한다. 이는 Hessian의 구조가 프루닝 성능에 결정적인 영향을 미치는 암묵적 편향을 유도한다는 것을 드러낸다. Hessian 기반 프루닝이 특징 공분산 스케일링에 대해 강건함을 보이며, 크기 기반 프루닝이 가중치 크기와 Hessian 중요도가 분리될 경우 특히 잘못된 초기화 조건에서 치명적인 실패를 겪는다는 것을 정확한 점근적 공식을 통해 입증한다.

ABSTRACT

Model pruning is an essential procedure for building compact and computationally-efficient machine learning models. A key feature of a good pruning algorithm is that it accurately quantifies the relative importance of the model weights. While model pruning has a rich history, we still don't have a full grasp of the pruning mechanics even for relatively simple problems involving linear models or shallow neural nets. In this work, we provide a principled exploration of pruning by building on a natural notion of importance. For linear models, we show that this notion of importance is captured by covariance scaling which connects to the well-known Hessian-based pruning. We then derive asymptotic formulas that allow us to precisely compare the performance of different pruning methods. For neural networks, we demonstrate that the importance can be at odds with larger magnitudes and proper initialization is critical for magnitude-based pruning. Specifically, we identify settings in which weights become more important despite becoming smaller, which in turn leads to a catastrophic failure of magnitude-based pruning. Our results also elucidate that implicit regularization in the form of Hessian structure has a catalytic role in identifying the important weights, which dictate the pruning performance.

연구 동기 및 목표

  • 과다 매개변수 모델에서 프루닝의 기본 메커니즘, 특히 Hessian 구조와 가중치 중요도의 역할을 이해하기 위해.
  • Hessian 기반, 크기 기반, 자연 중요도의 세 가지 프루닝 기준의 강건성과 성능을 비교하기 위해.
  • Hessian 구조에서 유도되는 암묵적 편향이 프루닝 결과에 미치는 영향을 정량화하기 위해, 특히 선형 모델과 두 층의 ReLU 네트워크에서.
  • 크기 기반 프루닝이 큰 가중치 크기를 가짐에도 불구하고 실패하는 조건을 특정하고, 적절한 초기화의 역할을 설명하기 위해.
  • 제어된 공분산 스케일링 하에서 프루닝 방법의 정확한 점근적 성능 공식을 유도하여 정밀한 비교를 가능하게 하기 위해.

제안 방법

  • 라벨을 유지하면서 특징 공분산 행렬(Hessian)의 대각 스케일링을 통해 동치의 선형 문제 클래스를 구성함으로써 Hessian 편향의 통제된 연구를 가능하게 한다.
  • 고차원 극한에서 프루닝 성능에 대한 정확한 점근적 공식을 유도하여, Hessian 및 자연 중요도는 스케일링 불변성을 보이며, 크기 기반 중요도는 불안정함을 입증한다.
  • 두 층의 ReLU 네트워크에 대해 간소화된 초기화 모델을 사용하여 Hessian 구조가 학습 동역학과 가중치 기여도에 미치는 영향을 분석한다.
  • Hessian가 더 크면 더 많은 기여를 한다는 '큰 Hessian가 더 많이 이긴다' 정리(‘larger Hessian wins more’ theorem)를 도입하여, 학습 중 가중치 그룹의 상대적 기여도를 Hessian 편향을 통해 정량화한다.
  • 고차원 확률 도구, 특히 농도 부등식과 극한 정리 등을 사용하여 대규모 표본 및 네트워크 크기 조건에서 최적화 및 프루닝의 거동을 분석한다.
  • 일반화 오차와 프루닝 유도 정확도 손실에 대한 분석적 표현을 유도하여, 고차원 극한에서의 프루닝 성능을 비교한다.

실험 결과

연구 질문

  • RQ1특징 공분산 스케일링(Hessian 구조)은 선형 모델에서 크기 기반 프루닝과 Hessian 기반 프루닝의 성능에 어떻게 영향을 미치는가?
  • RQ2왜 크기 기반 프루닝은 과다 매개변수 설정에서도 큰 가중치 크기를 가짐에도 불구하고 실패하는가?
  • RQ3Hessian 구조가 프루닝 성능 향상 또는 악화에 기여하는 암묵적 편향을 어느 정도 유도하는가?
  • RQ4적절한 초기화는 깊은 네트워크에서 가중치 크기와 Hessian 기반 중요도 간의 일치에 어떻게 영향을 미치는가?
  • RQ5고차원 설정에서 다양한 프루닝 기준의 성능을 비교하기 위해 정확한 점근적 공식을 도출할 수 있는가?

주요 결과

  • Hessian 기반 및 자연 중요도는 특징 공분산 행렬(Hessian)의 대각 스케일링에 대해 불변하며, 크기 기반 중요도는 이러한 스케일링에 매우 민감하여 과다 결정된 설정에서 취약하다.
  • 과다 매개변수 설정에서 Hessian 구조는 결정적 역할을 한다: Hessian에서 유도되는 암묵적 편향은 Hessian 기반 프루닝 성능을 향상시키지만, 크기 기반 프루닝 성능을 떨어뜨린다.
  • 논문은 프루닝 방법 간 성능 차이를 정확히 기록하는 점근적 공식을 도출하여, 주요 공분산 방향이 중요한 가중치와 정렬되지 않을 경우 부정적 편향이 존재함을 드러낸다.
  • 두 층의 ReLU 네트워크에서 Hessian 구조는 학습 동역학을 지배하여, 크기가 작더라도 Hessian 값이 큰 가중치가 더 많은 기여를 한다.
  • Hessian 기반 중요도가 학습 중 기여도를 결정하는 데 지배적임을 보여주는 '큰 Hessian가 더 많이 이긴다' 정리가 확립되었다. 특히 과다 매개변수 영역에서 두드러진다.
  • 가중치 크기와 Hessian 중요도가 반대 방향으로 이동할 경우, 크기 기반 프루닝은 치명적인 실패를 겪는다. 이는 적절한 학습 후에도 최적화의 암묵적 편향으로 인해 발생할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.