[논문 리뷰] Sparse Double Descent: Where Network Pruning Aggravates Overfitting
이 논문은 네트워크 프루닝이 초기에는 과적합으로 인해 일반화를 악화시킬 수 있고, 이후에 향상되다가 극단적인 희박성에서는 성능이 떨어지는 새로운 '희박 이중 하강' 현상을 소개한다. 이 현상은 ℓ₂ 학습 거리—학습 중 모델 가중치가 이동한 거리의 측정치—가 국소 최소값의 평탄함보다 일반화를 더 잘 예측할 수 있음을 제안하며, 프루닝된 모델에서 관찰된 비단조화적인 테스트 정확도 곡선을 설명한다.
People usually believe that network pruning not only reduces the computational cost of deep networks, but also prevents overfitting by decreasing model capacity. However, our work surprisingly discovers that network pruning sometimes even aggravates overfitting. We report an unexpected sparse double descent phenomenon that, as we increase model sparsity via network pruning, test performance first gets worse (due to overfitting), then gets better (due to relieved overfitting), and gets worse at last (due to forgetting useful information). While recent studies focused on the deep double descent with respect to model overparameterization, they failed to recognize that sparsity may also cause double descent. In this paper, we have three main contributions. First, we report the novel sparse double descent phenomenon through extensive experiments. Second, for this phenomenon, we propose a novel learning distance interpretation that the curve of $\ell_{2}$ learning distance of sparse models (from initialized parameters to final parameters) may correlate with the sparse double descent curve well and reflect generalization better than minima flatness. Third, in the context of sparse double descent, a winning ticket in the lottery ticket hypothesis surprisingly may not always win.
연구 동기 및 목표
- 네트워크 프루닝이 모델 일반화에 미치는 영향을 조사하여, 일반적으로 프루닝이 항상 과적합을 감소시킨다는 믿음을 도전한다.
- 새로운 현상인 '희박 이중 하강'을 규명하고, 실험적으로 입증한다. 이는 희박성 하에서 테스트 성능이 세 단계로 이루어진 비단조화적인 곡선을 보이며, 악화 → 향상 → 재악화의 순서를 따른다.
- 희박 모델의 일반화 지표로서 기존의 국소 최소값의 평탄도보다 더 뛰어난 성능을 보이는 ℓ₂ 학습 거리를 제안하고 검증한다.
- 희박 이중 하강의 맥락에서 로또 티켓 가설을 재평가하며, 원래 초기화로부터 재학습했을 때 승리 티켓이 항상 승리하지는 않음을 보여준다.
제안 방법
- 다양한 아키텍처(LeNet-300-100, ResNet-18)와 데이터셋(MNIST, CIFAR-10, CIFAR-100)을 대상으로, 레이블 노이즈 수준을 다양하게 조절하면서 크기 기반 프루닝을 통해 모델의 희박성을 체계적으로 증가시킨다.
- 최종 및 초기 모델 가중치 간의 차이의 L2 노름으로서 ℓ₂ 학습 거리를 측정하고 분석하며, 다양한 희박성 수준에서 테스트 정확도와의 상관관계를 분석한다.
- 다양한 재학습 전략(피닝튜닝, 학습률 복귀, 프루닝 후 무작위 초기화로부터의 스케치 재학습) 간의 일반화 성능를 비교한다.
- 희박 모델과 재밀도 모델 사이의 선형 보간을 수행하여 손실 및 정확도 궤적을 분석하고, 국소 최소값의 날카움을 평가한다.
- 필터 정규화를 사용한 손실 곡면 시각화를 통해 재밀도 학습 상황에서의 국소 최소값의 날카움을 평가한다.
- 다양한 희박성 수준과 노이즈 비율에서의 분석을 통해 희박 이중 하강 곡선의 강인함을 검증하기 위한 분석 연구를 수행한다.
실험 결과
연구 질문
- RQ1네트워크 프루닝은 항상 과적합을 감소시키는가, 아니면 일반화를 더 악화시킬 수 있는가?
- RQ2모델의 과다 파rameter화 외에도, 희박성 증가 시 이중 하강 유사 행동이 나타날 수 있는가?
- RQ3희박 모델에서 다양한 희박성 수준에서 ℓ₂ 학습 거리가 테스트 성능과 어떻게 상관관계가 있는가?
- RQ4희박 이중 하강 하에서 로또 티켓 가설은 유지되는가, 아니면 무작위로 재초기화된 프루닝된 모델이 원래의 승리 티켓보다 성능이 뛰어날 수 있는가?
- RQ5극도의 희박성 수준에서 성능 저하의 원인은 무엇이며, 정보 유실과 어떻게 관련되어 있는가?
주요 결과
- 논문은 희박 이중 하강 현상이라는 새로운 현상을 보고한다. 이는 테스트 정확도가 중간 수준의 희박성에서 과적합으로 인해 일시적으로 악화되고, 이후 과적합 감소로 인해 향상되며, 극단적인 희박성에서 정보 손실로 인해 다시 악화되는 세 단계 곡선을 보인다.
- 프루닝된 모델의 ℓ₂ 학습 거리는 희박 이중 하강 곡선과 강하게 상관되며, 특히 과적합 단계에서 국소 최소값의 평탄도보다 일반화를 더 잘 반영한다.
- 중간 수준의 희박성에서 프루닝된 모델은 더 높은 과적합을 보이며, 테스트 정확도가 상당히 떨어진다. 예를 들어, 20% 레이블 노이즈 하에서는 밀도 모델 대비 최대 15–20% 낮은 성능을 보인다.
- 로또 티켓 가설에서 유래한 승리 티켓이 항상 가장 잘 일반화하지는 않는다. 일부 사례에서는 원래 승리 티켓의 초기화로부터 재학습하는 것보다, 프루닝 후 무작위 초기화로부터 재학습한 모델이 더 높은 성능을 보였다.
- 프루닝 후 0으로 초기화된 가중치에서 재밀도 학습을 수행하면, 특히 높은 희박성 수준에서 더 날카운 최소값을 유도할 수 있다. 이는 1차원 손실 시각화를 통해 확인되었다.
- 학습 거리는 희박 이중 하강의 '비상적 단계'에서 일반화를 가장 잘 예측하며, 이 단계는 과적합이 가장 심각한 시점이다. 이는 치명적인 과적합 기간 동안 가중치 궤적의 역학을 잘 포착하고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.