Skip to main content
QUICK REVIEW

[논문 리뷰] Kronecker-factored Quasi-Newton Methods for Convolutional Neural Networks.

Yi Ren, Donald Goldfarb|arXiv (Cornell University)|2021. 02. 12.
Matrix Theory and Algorithms참고 문헌 30인용 수 7
한 줄 요약

이 논문은 콘volution 신경망을 훈련시키기 위한 크로네커 분해된 준뉴턴 방법인 KF-QN-CNN을 제안한다. 이 방법은 층별 블록 대각 행렬을 사용하여 헤시안을 근사하며, 이 행렬은 크로네커 곱으로 구성되어 있어, 제1순위 메모리 비용으로도 효율적인 제2순위 최적화를 가능하게 하며, 최신 제1·제2순위 방법보다 뛰어난 수렴 성능을 보인다.

ABSTRACT

Second-order methods have the capability of accelerating optimization by using much richer curvature information than first-order methods. However, most are impractical in a deep learning setting where the number of training parameters is huge. In this paper, we propose KF-QN-CNN, a new Kronecker-factored quasi-Newton method for training convolutional neural networks (CNNs), where the Hessian is approximated by a layer-wise block diagonal matrix and each layer's diagonal block is further approximated by a Kronecker product corresponding to the structure of the Hessian restricted to that layer. New damping and Hessian-action techniques for BFGS are designed to deal with the non-convexity and the particularly large size of Kronecker matrices in CNN models and convergence results are proved for a variant of KF-QN-CNN under relatively mild conditions. KF-QN-CNN has memory requirements comparable to first-order methods and much less per-iteration time complexity than traditional second-order methods. Compared with state-of-the-art first- and second-order methods on several CNN models, KF-QN-CNN consistently exhibited superior performance in all of our tests.

연구 동기 및 목표

  • 깊은 학습에서 전통적인 제2순위 방법의 높은 메모리 및 계산 비용으로 인한 비현실성 문제를 해결하기 위해.
  • 콘볼루션 신경망의 구조적 특성에 맞는 곡률 인식 최적화 방법을 개발하기 위해.
  • 제2순위 최적화의 메모리 및 시간 복잡도를 낮추면서도 그 수렴 이점을 유지하기 위해.
  • 비볼록성과 대규모 CNN 훈련에 적합한 안정적인 덤핑 및 헤시안 작용 기법을 설계하기 위해.
  • 약한 조건 하에서 제안된 방법의 변종에 대해 수렴 보장을 확보하기 위해.

제안 방법

  • 헤시안은 각 층의 매개변수 공간에 해당하는 블록 대각 행렬로 근사된다.
  • 헤시안의 각 대각 블록은 콘볼루션 신경망의 가중치 텐서 구조를 활용하기 위해 크로네커 곱으로 추가 근사된다.
  • 비볼록 설정에서 업데이트를 안정화시키기 위해 새로운 덤핑 기법이 도입되어 훈련 중 안정성을 향상시킨다.
  • 명시적 행렬 형성 없이도 헤시안 근사를 효율적으로 적용하기 위해 특수화된 헤시안 작용 기법이 설계되었다.
  • BFGS 업데이트 규칙이 크로네커 분해된 헤시안 근사와 함께 작동하도록 수정되어 준뉴턴 성질을 유지한다.
  • 제한된 가정 하에, 예를 들어 곡률가 제한되고 충분한 내림폭이 확보될 경우, KF-QN-CNN의 변종에 대해 수렴성이 증명되었다.

실험 결과

연구 질문

  • RQ1크로네커 분해된 헤시안 근사는 대규모 CNN에서 메모리 및 시간 비용을 관리 가능한 수준으로 유지하면서 제2순위 최적화를 가능하게 할 수 있는가?
  • RQ2비볼록성과 고차원 CNN 환경에서 훈련을 안정화하기 위해 덤핑 및 헤시안 작용 기법을 어떻게 설계할 수 있는가?
  • RQ3제안된 방법은 표준 CNN 아키텍처에서 최신 제1·제2순위 기준 대비 더 빠른 수렴성과 더 나은 일반화 성능을 달성하는가?
  • RQ4실제 딥러닝 조건 하에서 KF-QN-CNN 프레임워크에 대해 어떤 이론적 수렴 보장을 설정할 수 있는가?
  • RQ5제1순위 메모리 복잡도를 유지하면서 제2순위 최적화 이점을 달성할 수 있는가?

주요 결과

  • KF-QN-CNN는 제1순위 방법과 유사한 메모리 요구량을 보여, 대규모 모델에 적용 가능하다.
  • 전통적인 제2순위 방법보다 반복당 시간 복잡도가 크게 낮다.
  • 여러 CNN 모델에서 KF-QN-CNN는 최신 제1·제2순위 최적화 방법보다 훈련 성능에서 일관되게 뛰어나다.
  • 제한된 조건 하에, 예를 들어 곡률가 제한되고 충분한 내림폭이 확보될 경우, KF-QN-CNN의 변종에 대해 이론적 수렴성이 확립되었다.
  • 제안된 덤핑 및 헤시안 작용 기법은 비볼록성과 대규모 크로네커 행렬이 초래하는 과제를 효과적으로 관리한다.
  • KF-QN-CNN는 크로네커 분해를 통해 CNN 가중치 행렬의 구조적 희소성을 효과적으로 활용하여 제2순위 최적화의 확장성을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.