Skip to main content
QUICK REVIEW

[논문 리뷰] Distance-Based Regularisation of Deep Networks for Fine-Tuning

Henry Gouk, Timothy M. Hospedales|arXiv (Cornell University)|2020. 02. 19.
Advanced Neural Network Applications참고 문헌 35인용 수 6
한 줄 요약

이 논문은 MARS(MAximum Absolute Row Sum) 노름을 사용하여 사전 훈련된 가중치 주변의 작은 구에 가중치 갱신을 제약함으로써 딥 네ural 네트워크의 토닝을 위한 거리 기반 정규화 방법을 제안한다. 이는 이론적으로도 실험적으로도 MARS 기반 제약가 타원 거리 페널티와 표준 토닝보다 우월하며, 이미지 분류 벤치마크에서 더 나은 일반화 성능과 최신 기술 수준의 성능을 달성함을 보여준다.

ABSTRACT

We investigate approaches to regularisation during fine-tuning of deep neural networks. First we provide a neural network generalisation bound based on Rademacher complexity that uses the distance the weights have moved from their initial values. This bound has no direct dependence on the number of weights and compares favourably to other bounds when applied to convolutional networks. Our bound is highly relevant for fine-tuning, because providing a network with a good initialisation based on transfer learning means that learning can modify the weights less, and hence achieve tighter generalisation. Inspired by this, we develop a simple yet effective fine-tuning algorithm that constrains the hypothesis class to a small sphere centred on the initial pre-trained weights, thus obtaining provably better generalisation performance than conventional transfer learning. Empirical evaluation shows that our algorithm works well, corroborating our theoretical results. It outperforms both state of the art fine-tuning competitors, and penalty-based alternatives that we show do not directly constrain the radius of the search space.

연구 동기 및 목표

  • 초기 가중치에서의 가중치 이동을 제어함으로써 일반화 성능을 향상시키는 이론적으로 탄탄한 정규화 전략을 개발하는 것.
  • 다양한 거리 측도(예: MARS 대비 타원 거리)를 사용한 거리 기반 정규화가 토닝 성능에 미치는 영향을 조사하는 것.
  • 훈련 중 가중치 거리에 대한 페널티 기반 정규화와 하드 제약 간의 효과성을 비교하는 것.
  • 커버링 수 또는 모델 분포에 의존하지 않고, 초기 값으로부터의 가중치 이동 거리에 명시적으로 의존하는 라데마처 복잡도를 기반으로 한 새로운 일반화 경계를 제공하는 것.
  • 실증적으로 MARS 기반 제약가 표준 토닝 및 페널티 기반 대안보다 실생활에서 더 나은 성능을 보임을 검증하는 것.

제안 방법

  • MARS 및 프로베니우스 노름을 사용하여, 최종 가중치가 초기 값으로부터 얼마나 이동했는지에 따라 의존하는 새로운 라데마처 복잡도 일반화 경계를 유도한다.
  • 두 가지 투영 기반 토닝 알고리즘인 MARS-PGM과 ℓ²-PGM을 도입하며, 각각 MARS 및 타원 거리에 하드 제약를 걸기 위해 투영된 확률적 하향부분미분 방법을 사용한다.
  • 손실 함수에 MARS 거리를 정규화하는 페널티 기반 방법을 제안하여 제약 기반 방법과의 비교를 위한 기준으로 삼는다.
  • 표준 CNN 아키텍처를 사용하여 MNIST에서 경계와 방법의 실증적 평가를 수행하며, 훈련 전반에 걸쳐 모델 복잡도와 일반화 성능을 측정한다.
  • 조기 정지와 정규화되지 않은 훈련을 기준으로 삼아 암묵적 정규화 효과를 평가하고, 명시적 정규화 전략을 비교한다.
  • Adam 최적화기와 함께 성능을 평가하며, 훈련 전반에 걸쳐 테스트 정확도와 모델 복잡도 지표를 측정하여 일반화 및 제약 효과성을 평가한다.

실험 결과

연구 질문

  • RQ1초기 값으로부터의 가중치 이동 거리에 기반한 일반화 경계가 기존 경계보다 더 날카롭고 관련성이 있는 성능 보장을 제공하는가?
  • RQ2컨volutional 네트워크의 가중치 공간에서 거리 측도로 MARS 노름이 프로베니우스 또는 스펙트럴 노름보다 더 적합한가?
  • RQ3투영을 통한 하드 제약(예: 투영 방법)이 페널티 기반 정규화보다 성능이 뛰어나게 되는가?
  • RQ4MARS 기반 정규화가 표준 토닝 및 기존 최신 기술 수준의 방법보다 더 나은 테스트 성능을 낼 수 있는가?
  • RQ5조기 정지에 의한 암묵적 정규화가 모델 복잡도와 일반화 측면에서 명시적 정규화 전략과 어떻게 상호작용하는가?

주요 결과

  • MARS 기반 일반화 경계는 특히 컨volutional 네트워크의 맥락에서 프로베니우스 또는 스펙트럴 노름에 기반한 경계보다 훨씬 더 날카롭다.
  • 실증적 평가에서 MARS-PGM(MARS 제약를 가진 투영된 하향부분미분 방법)는 MNIST에서 ℓ²-PGM 및 표준 토닝보다 뛰어난 성능을 보이며, 더 높은 테스트 정확도와 더 나은 일반화 성능을 달성한다.
  • 페널티 기반 정규화조차도 제약 반경을 맞추더라도, 투영 방법을 통한 하드 제약가 더 나은 성능을 낸다.
  • 특히 컨volutional 아키텍처에서 MARS 거리가 정규화 메트릭으로 사용될 경우, 타원 거리보다 더 효과적인 가설 클래스 제약가 가능하다.
  • 초기 가중치가 증가함에도 불구하고 모델 복잡도 측정치가 정체되는 경향이 있어, 조기 정지에 의한 암묵적 정규화가 명시적 정규화의 전체 잠재적 이점을 가리고 있을 수 있음을 시사한다.
  • 제안된 MARS-PGM 방법은 토닝 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 딥 러닝에서 제약 기반 정규화가 페널티 기반 대안보다 더 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.