[논문 리뷰] OptG: Optimizing Gradient-driven Criteria in Network Sparsity
OptG는 기울기 기반 네트워크 희소성 최적화를 위해 독립성 역설을 해결함으로써 새로운 방법을 제안한다—즉, 가중치 제거 시 매개변수의 독립성을 가정하지만, 현실 세계의 가중치 상호의존성과 모순된다. 슈퍼마스크 학습과 역설 인지 슈퍼마스크 최적화기를 통합하여 마스크 기울기의 누적과 희소성 적응형 학습률을 사용함으로써, 특히 초고희소성 수준에서 최첨단 성능을 달성한다. 예를 들어, ResNet-50에서 98% 희소성일 때 ImageNet에서 67.20%의 top-1 정확도를 기록한다.
Network sparsity receives popularity mostly due to its capability to reduce the network complexity. Extensive studies excavate gradient-driven sparsity. Typically, these methods are constructed upon premise of weight independence, which however, is contrary to the fact that weights are mutually influenced. Thus, their performance remains to be improved. In this paper, we propose to optimize gradient-driven sparsity (OptG) by solving this independence paradox. Our motive comes from the recent advances in supermask training which shows that high-performing sparse subnetworks can be located by simply updating mask values without modifying any weight. We prove that supermask training is to accumulate the criteria of gradient-driven sparsity for both removed and preserved weights, and it can partly solve the independence paradox. Consequently, OptG integrates supermask training into gradient-driven sparsity, and a novel supermask optimizer is further proposed to comprehensively mitigate the independence paradox. Experiments show that OptG can well surpass many existing state-of-the-art competitors, especially at ultra-high sparsity levels. Our code is available at \url{https://github.com/zyxxmu/OptG}.
연구 동기 및 목표
- 기울기 기반 희소성에서 발생하는 독립성 역설을 해결하라—즉, 가중치 제거 시 매개변수의 독립성을 가정하지만, 실제로는 상호 영향을 미치는 가중치 간의 의존성과 모순된다.
- 기존 기울기 기반 방법의 한계를 조사하라—즉, 한 번에 모든 가중치를 제거함으로써 손실 변화 추정이 정확하지 않게 된다.
- 슈퍼마스크 학습의 통찰을 활용하여, 상호의존성 하에서 진정한 가중치 중요도를 더 잘 근사하는 방법을 개발하라.
- 희소성 진행에 따라 마스크 학습률을 동적으로 조정하는 새로운 슈퍼마스크 최적화기를 제안하라—이를 통해 오차 갭을 최소화한다.
- 특히 기울기 기반 희소성에서 독립성 역설이 성능 저하를 가장 크게 유도하는 초고희소성 수준에서 최첨단 성능을 달성하라.
제안 방법
- 모든 훈련 에포크의 시작 시에만 이진 마스크를 업데이트하는 슈퍼마스크 최적화기를 도입하며, 이는 마스크 기울기를 훈련 반복 동안 누적한다.
- 현재 희소성 수준에 비례하여 마스크 학습률을 조정하는 역설 인지 학습률 스케줄을 제안함으로써, 가중치 상호의존성으로 인한 오차를 감소시킨다.
- 직선 통과 추정을 통해 손실를 최적화하면서도 가중치를 유지하는 동안 훈련 중 희소성에 슈퍼마스크 학습을 통합한다.
- 슈퍼마스크 학습이 보존된 가중치와 제거된 가중치 모두에 대해 기울기 기반 희소성 기준을 암묵적으로 누적함을 증명함으로써, 독립성 역설에 대한 부분적 해결책을 제공한다.
- 손실 함수의 일阶 및 고계 테일러 근사식을 사용하여 가중치 중요도를 측정하며, OptG는 동적 마스크 최적화를 통해 이 기준을 정밀하게 개선한다.
- 점진적인 희소성 스케줄을 적용하여, 희소화 이전에 가중치를 원래 값으로 복원함으로써 고희소성 수준에서 안정적인 훈련과 더 나은 수렴을 가능하게 한다.

실험 결과
연구 질문
- RQ1기울기 기반 희소성에서의 독립성 가정이 고희소성 수준에서 성능을 얼마나 떨어뜨리는가?
- RQ2슈퍼마스크 학습은 기울기 기반 희소성 기준과 이론적으로 연결될 수 있는가? 그리고 이는 독립성 역설에 대한 부분적 해결책을 제공하는가?
- RQ3마스크 최적화를 위한 희소성 적응형 학습률 스케줄은 고정 또는 가중치 동기화 스케줄 대비 성능에 어떤 영향을 미치는가?
- RQ4슈퍼마스크 학습을 동안 희소성과 병행 적용할 경우, 극단적 희소성 수준에서 더 나은 일반화와 높은 정확도를 달성할 수 있는가?
- RQ5동적 마스크 최적화를 통한 희소 훈련에서 마스크 업데이트 빈도는 훈련 안정성과 성능에 어떤 영향을 미치는가?
주요 결과
- OptG는 ResNet-50에서 98% 희소성일 때 ImageNet에서 67.20%의 top-1 정확도를 기록하며, 동일 조건에서 강력한 베이스라인인 STR(62.84%)를 크게 앞서나간다.
- 95% 희소성일 때, OptG는 제안된 희소성 스케줄 하에서 72.38%의 top-1 정확도를 달성하며, Zhu et al.의 스케줄 하에서의 성능(71.82%)을 초월하고, SET, RigL, DPF를 모두 앞선다.
- 제거 실험을 통해 제안된 역설 인지 학습률 스케줄이 일정 학습률 및 가중치 동기화 학습률보다 우수함을 확인하였으며, 오차 갭을 효과적으로 완화함을 입증한다.
- 높은 빈도로 마스크를 업데이트할 경우 희소 훈련 과정의 불안정성으로 인해 성능이 떨어지므로, OptG에서의 에포크 단위로 희소한 마스크 업데이트 방식의 이점이 뚜렷하다.
- MobileNet-V1에서 90% 희소성일 때 OptG는 70.27%의 top-1 정확도를 기록하며, 동일 희소성 수준에서 STR(66.80%)와 GMP(61.80%)를 모두 앞선다.
- 수동 설계 없이도 레이어별 희소성 패턴을 자동으로 학습함으로써, 다양한 네트워크 아키텍처와 희소성 범위에서의 적응성을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.