Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating the Hessian by Back-propagating Curvature

James Martens, Ilya Sutskever|arXiv (Cornell University)|2012. 06. 27.
Model Reduction and Neural Networks참고 문헌 12인용 수 19
한 줄 요약

이 논문은 계산 그래프를 통해 정의된 미분 가능 함수의 헤시안을 효율적으로 추정하기 위한 백프로파게이션 기반의 새로운 방법인 곡률 전파(Curvature Propagation, CP)를 소개한다. 표준 백프로파게이션을 초과해 추가로 두 번의 기울기 평가만으로도 CP는 헤시안에 대한 불편성 있고 랭크-1 근사치를 제공하며, 반복적으로 추정치를 정밀화함으로써 신경망과 스코어 매칭 응용 분야에서 대각 헤시안과 전체 헤시안 모두 높은 정확도를 달성한다.

ABSTRACT

In this work we develop Curvature Propagation (CP), a general technique for efficiently computing unbiased approximations of the Hessian of any function that is computed using a computational graph. At the cost of roughly two gradient evaluations, CP can give a rank-1 approximation of the whole Hessian, and can be repeatedly applied to give increasingly precise unbiased estimates of any or all of the entries of the Hessian. Of particular interest is the diagonal of the Hessian, for which no general approach is known to exist that is both efficient and accurate. We show in experiments that CP turns out to work well in practice, giving very accurate estimates of the Hessian of neural networks, for example, with a relatively small amount of work. We also apply CP to Score Matching, where a diagonal of a Hessian plays an integral role in the Score Matching objective, and where it is usually computed exactly using inefficient algorithms which do not scale to larger and more complex models.

연구 동기 및 목표

  • 딥 러닝 모델에서 헤시안, 특히 그 대각 성분을 효율적이고 정확하게 계산하는 데 필요한 방법의 부족을 해결한다.
  • 계산 그래프를 통해 정의된 복잡한 미분 가능 함수의 헤시안을 추정할 수 있는 확장 가능한 기법을 개발한다.
  • 정확한 계산이 불가능한 대규모 모델에서 최적화 및 정규화를 위한 정확한 헤시안 추정을 가능하게 한다.
  • 다양한 머신러닝 목표에 적용 가능한 일반 목적의 솔루션을 제공하여 전체 헤시안과 대각 헤시안 추정에 모두 활용할 수 있다.
  • 기존의 대각 헤시안 추정 방법의 한계를 극복하며, 이는 일반적으로 정확도가 떨어지거나 복잡한 모델에 대해 계산 비용이 지나치게 높기 때문이다.

제안 방법

  • 두 번째 차수 정보를 사용하여 편향 없는 헤시안 근사치를 계산하는 백프로파게이션 스타일의 알고리즘인 곡률 전파(CP)를 제안한다.
  • 평균이 0이고 분산이 1인 랜덤 벡터를 사용하여 헤시안-벡터 곱을 통해 헤시안의 랭크-1 근사치를 생성한다.
  • 역방향 미분을 통해 헤시안-벡터 곱을 적용하며, 기존의 백프로파게이션 인fra구조를 재사용한다.
  • 독립적인 랜덤 벡터를 반복적으로 적용하여 헤시안 추정치의 분산을 줄이고 정밀도를 향상시킨다.
  • 다양한 랭크-1 근사치를 누적시켜 대각 헤시안과 전체 헤시안 성분을 모두 추정할 수 있도록 한다.
  • 전방 계산 그래프를 수정하지 않고도 기존 계산 그래프에 CP를 통합하여 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1표준 백프로파게이션을 초과해 추가로 두 번의 기울기 평가만으로도 헤시안의 편향 없는 낮은 랭크 근사치를 계산할 수 있는가?
  • RQ2일반적으로 효율적인 방법이 없는 깊은 신경망에서 곡률 전파가 대각 헤시안을 정확하게 추정할 수 있는가?
  • RQ3스코어 매칭에서 사용되는 대규모 모델에서 CP는 정확하거나 근사된 헤시안 계산과 비교해 어떻게 성능을 내는가?
  • RQ4복잡하고 고차원적인 머신러닝 목표에 대해 추가 계산 비용 없이 CP를 효율적으로 적용할 수 있는가?
  • RQ5CP를 반복적으로 적용하면 다양한 모델 아키텍처에서 점점 더 정확하고 안정적인 헤시안 추정치를 얻을 수 있는가?

주요 결과

  • CP는 표준 백프로파게이션을 초과해 추가로 두 번의 기울기 평가만으로도 헤시안에 대한 편향 없는 추정치를 제공한다.
  • 이 방법은 기존의 근사 방법보다 깊은 신경망에서 대각 헤시안을 추정하는 데 높은 정확도를 달성한다.
  • CP는 정확한 대각 헤시안 계산이 일반적으로 대규모 모델에서 너무 느려서 어려운 스코어 매칭에서 헤시안의 효율적 계산을 가능하게 한다.
  • CP를 반복적으로 적용하면 추정치의 분산이 감소하여 추가 비용을 최소한으로 하면서 점점 더 정밀한 헤시안 근사치를 도출할 수 있다.
  • 실험 결과에 따르면 CP는 고차원 환경에서도 신뢰할 수 있는 헤시안 추정치를 생성하며, 강건성과 확장성을 입증한다.
  • 이 방법은 일반적이며 계산 그래프를 통해 계산되는 모든 함수에 적용 가능하므로 머신러닝 작업 전반에 널리 활용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.