Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring and regularizing networks in function space

Ari S. Benjamin, David Rolnick|arXiv (Cornell University)|2018. 05. 21.
Machine Learning and Algorithms참고 문헌 30인용 수 17
한 줄 요약

이 논문은 $L^2$ 거리로 기능 공간 내에서 신경망 최적화를 직접 측정하고 정규화하는 방법을 제안하며, 학습 과정에서 매개변수 공간과 기능 공간 간의 거리가 분리됨을 보여준다. 힐버트 제약 경사하강법(HCGD)과 $L^2$ 기반 다중 작업 정규화를 도입하여 학습된 함수에 대한 파괴적인 변화를 최소화함으로써 일반화 성능을 향상시키며, 순차적 작업인 퍼미uted MNIST에서 SGD보다 HCGD가 뛰어난 성능을 보인다.

ABSTRACT

To optimize a neural network one often thinks of optimizing its parameters, but it is ultimately a matter of optimizing the function that maps inputs to outputs. Since a change in the parameters might serve as a poor proxy for the change in the function, it is of some concern that primacy is given to parameters but that the correspondence has not been tested. Here, we show that it is simple and computationally feasible to calculate distances between functions in a $L^2$ Hilbert space. We examine how typical networks behave in this space, and compare how parameter $\ell^2$ distances compare to function $L^2$ distances between various points of an optimization trajectory. We find that the two distances are nontrivially related. In particular, the $L^2/\ell^2$ ratio decreases throughout optimization, reaching a steady value around when test error plateaus. We then investigate how the $L^2$ distance could be applied directly to optimization. We first propose that in multitask learning, one can avoid catastrophic forgetting by directly limiting how much the input/output function changes between tasks. Secondly, we propose a new learning rule that constrains the distance a network can travel through $L^2$-space in any one update. This allows new examples to be learned in a way that minimally interferes with what has previously been learned. These applications demonstrate how one can measure and regularize function distances directly, without relying on parameters or local approximations like loss curvature.

연구 동기 및 목표

  • 신경망 최적화 과정에서 매개변수 공간과 기능 공간 궤적 간의 관계를 조사하는 것.
  • 매개변수에 종속되지 않은 입력-출력 함수의 변화를 측정하는 직접적인 지표를 개발하는 것.
  • 기능 공간 내 이동을 제약함으로써 학습을 정규화하는 새로운 최적화 전략을 제안하여 일반화 성능 향상과 치명적인 잊힘 방지를 도모하는 것.
  • 기능 공간 정규화가 다중 작업 및 순차적 학습 환경에서 전통적인 매개변수 기반 정규화보다 우수한 성능을 낼 수 있음을 보여주는 것.

제안 방법

  • 신경망 함수 간의 거리를 $L^2$ 노름을 사용해 측정: $\|f - g\|^2 = \mathbb{E}_X[|f(x) - g(x)|^2]$, 미니배치 추론을 통해 근사.
  • SGD 최적화 궤적을 따라 $L^2$ 기능 공간 거리와 $\ell^2$ 매개변수 공간 거리를 실증적으로 비교.
  • 각 최적화 단계에서 기능의 $L^2$ 변화가 큰 것을 방지하기 위해 힐버트 제약 경사하강법(HCGD)을 제안.
  • 이전 작업에 대한 기능 변화를 제한하기 위해 과거 입력의 워킹 메모리 저장을 활용하는 $L^2$ 기반 다중 작업 정규화를 도입.
  • 데이터 배치에 대한 경험적 기대값을 사용해 $L^2$ 거리를 추정함으로써, 명시적인 기능 표현 없이도 효율적인 계산을 가능하게 한다.
  • HCGD를 Adam 최적화기와 조합하여 순차적 학습 작업(예: 퍼미uted MNIST)에서 성능 향상을 도모.

실험 결과

연구 질문

  • RQ1SGD 최적화 과정에서 기능 공간 궤적과 매개변수 공간 궤적은 어떻게 다를까?
  • RQ2매개변수 간 $\ell^2$ 거리가 기능 간 $L^2$ 거리의 신뢰할 수 있는 대체 지표가 되는가?
  • RQ3기능 공간 이동에 대한 직접적인 정규화가 다중 작업 학습에서 일반화 성능 향상에 기여할 수 있는가?
  • RQ4HCGD를 통해 기능 공간 이동을 제약하면 표준 SGD보다 테스트 성능이 향상되는가?
  • RQ5학습 과정에서 $L^2/\ell^2$ 비율은 어떻게 변화하며, 이는 최적화 역학에 대해 무엇을 드러내는가?

주요 결과

  • $L^2/\ell^2$ 비율은 학습 과정에서 감소하며, 테스트 오차가 정체되는 시점에 안정화되며, 이는 매개변수 공간과 기능 공간 이동 간의 비트리비얼한 관계를 시사한다.
  • 힐버트 제약 경사하강법(HCGD)은 순차적 MNIST 작업에서 표준 SGD와 Adam보다 높은 테스트 정확도를 달성한다.
  • $L^2$ 기반 다중 작업 정규화 방법은 이전 작업의 저장된 예시를 재학습하는 것보다 더 뛰어난 데이터 효율성을 보인다.
  • HCGD를 Adam과 조합한 (Adam+HC)는 반복적 작업에서 최신 기술 성능을 달성하며, 제어된 기능 공간 이동을 통한 일반화 성능 향상이 가능함을 시사한다.
  • 중간 크기의 배치 크기로도 $L^2$ 거리 추정기는 신뢰할 수 있으며, 낮은 분산과 양호한 경험적 근사 품질을 보인다.
  • HCGD는 자연 경사와 개념적으로 유사하며, 둘 다 기능 공간 내 변화를 제약하지만, 서로 다른 발산 방식(Kullback-Leibler 대비 $L^2$)을 사용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.