Skip to main content
QUICK REVIEW

[논문 리뷰] REPAIR: REnormalizing Permuted Activations for Interpolation Repair

Keller Jordan, Hanie Sedghi|arXiv (Cornell University)|2022. 11. 15.
Advanced Neural Network Applications인용 수 11
한 줄 요약

이 논문은 REPAIR를 소개하며, 선형 보간된 딥 네ural 네트워크에서 분산 붕괴를 완화하기 위해 전활성화를 재가중함으로써 SGD 해의 간격에서 훨씬 낮은 손실 장벽을 가능하게 한다. REPAIR는 아키텍처에 관계없이 60%-100%의 보간 장벽 감소를 이끌어내며, 뉴런 정렬과 결합했을 때 ResNet50/ImageNet에서 74%의 장벽 감소와 ResNet18/CIFAR-10에서 90%의 장벽 감소를 달성한다.

ABSTRACT

In this paper we look into the conjecture of Entezari et al. (2021) which states that if the permutation invariance of neural networks is taken into account, then there is likely no loss barrier to the linear interpolation between SGD solutions. First, we observe that neuron alignment methods alone are insufficient to establish low-barrier linear connectivity between SGD solutions due to a phenomenon we call variance collapse: interpolated deep networks suffer a collapse in the variance of their activations, causing poor performance. Next, we propose REPAIR (REnormalizing Permuted Activations for Interpolation Repair) which mitigates variance collapse by rescaling the preactivations of such interpolated networks. We explore the interaction between our method and the choice of normalization layer, network width, and depth, and demonstrate that using REPAIR on top of neuron alignment methods leads to 60%-100% relative barrier reduction across a wide variety of architecture families and tasks. In particular, we report a 74% barrier reduction for ResNet50 on ImageNet and 90% barrier reduction for ResNet18 on CIFAR10.

연구 동기 및 목표

  • 표준 딥 네트워크에서 뉴런 정렬이 선형 보간 장벽을 낮추는 데 실패하는 이유를 조사하는 것.
  • 보간된 네트워크에서 성능 저하의 근본 원인인 활성화의 분산 붕괴를 특정하고 이를 해결하는 것.
  • 아키텍처 변경(예: LayerNorm 포함) 없이도 보간 모델의 성능을 복원할 수 있는 일반적인 보정 방법을 개발하는 것.
  • REPAIR가 표준 BatchNorm 네트워크에서 저장벽 연결을 가능하게 함으로써 Entezari 등(2021)의 순열 불변 보간에 대한 추측을 뒷받침하는지 검증하는 것.
  • 실세계 벤치마크에서 모델 병합, 앙상블, 미세조정 등 응용 분야에서 REPAIR의 실용적 이점을 입증하는 것.

제안 방법

  • REPAIR는 각 레이어별로 학습된 스케일링 인자값을 사용해 보간된 네트워크의 전활성화를 재가중시하여 분산 붕괴를 해결한다.
  • 이 방법은 보간된 네트워크의 각 레이어 출력 전활성화에 정규화 유사 보정을 적용하여 활성화 분산을 복원한다.
  • REPAIR는 뉴런 정렬 후, 한 네트워크의 은닉 유닛을 다른 네트워크와 일치시키기 위해 순열을 적용한 후, 보간 모델을 평가하기 전에 적용된다.
  • 스케일링 인자값은 보간된 네트워크 내 전활성화 통계를 기반으로 계산되며, 보간 과정에서 관찰된 붕괴를 효과적으로 역전시킨다.
  • 이 접근법은 평균 모델에서 BatchNorm 통계를 재설정하는 아이디어를 일반화하여, 순열된 가중치를 가진 보간 모델로 확장한다.
  • REPAIR는 BatchNorm 및 LayerNorm을 포함한 다양한 정규화 레이어와 호환되며, 다양한 네트워크 폭과 깊이에서 작동한다.

실험 결과

연구 질문

  • RQ1표준 딥 네트워크에서 뉴런 정렬이 이론적으로는 유망하지만, 왜 저장벽 선형 보간을 달성하지 못하는가?
  • RQ2보간된 네트워크에서 성능 저하를 유발하는 근본적 메커니즘은 무엇이며, 이를 체계적으로 수정할 수 있는가?
  • RQ3보간된 네트워크에 대한 후처리 보정을 통해 아키텍처 수정 없이 성능을 복원할 수 있는가?
  • RQ4REPAIR는 표준 BatchNorm 네트워크에서 저장벽 연결을 가능하게 하는가? 이는 이전 연구에서 LayerNorm를 사용한 결과와의 모순을 해결하는가?
  • RQ5REPAIR는 분할된 데이터 분할에서 훈련된 모델의 앙상블 및 구성적 병합 등 실용적 응용에서 성능 향상을 이끌 수 있는가?

주요 결과

  • ResNet50/ImageNet에서 REPAIR는 보간 장벽을 74% 감소시켜 정확도를 1% 미만에서 56.5%로 향상시켰다.
  • CIFAR-10에서 ResNet18에 대해 REPAIR는 90%의 장벽 감소를 달성하여 손실 장벽을 16%에서 1.5%로 낮췄다.
  • 이 방법은 보간된 네트워크에서 분산 붕괴를 효과적으로 완화하여 활성화 분산을 원래 수준에 가깝게 복원한다.
  • REPAIR는 이전에는 유사한 결과를 달성하기 위해 LayerNorm가 필요했던 표준 BatchNorm 네트워크에서도 저장벽 연결을 가능하게 한다.
  • 분할된 데이터 훈련에서, REPAIR 처리된 보간 모델은 전체 CIFAR-100 테스트 세트에서 양 끝점보다 우수한 성능을 보였으며, α=0.3일 때 테스트 손실이 1.30으로, 이전 연구의 1.73보다 낮았다.
  • 아키텍처에 관계없이 일관된 성능 향상이 나타나며, 다양한 네트워크 폭과 깊이에서 장벽 감소율이 60%에서 100%에 이르렀다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.