Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Fine-Tuning of Deep Neural Networks with Hessian-based Generalization Guarantees

Haotian Ju, Dongyue Li|arXiv (Cornell University)|2022. 06. 06.
Machine Learning and Data Classification인용 수 6
한 줄 요약

이 논문은 미세조정된 딥 네트워크를 위한 헤시안 기반 일반화 측도를 제안하며, 이 측도가 경험적 일반화 갭과 강한 상관관계를 보임을 보여준다. 이는 헤시안 정보를 통합한 패킷-베이지안 일반화 경계를 도입하고, 레이블 노이즈 하에서 과적합을 줄이는 강력한 미세조정 알고리즘을 개발하여 기존 방법 대비 이미지 작업에서 평균 3.26%의 정확도 향상을 달성한다.

ABSTRACT

We consider fine-tuning a pretrained deep neural network on a target task. We study the generalization properties of fine-tuning to understand the problem of overfitting, which has often been observed (e.g., when the target dataset is small or when the training labels are noisy). Existing generalization measures for deep networks depend on notions such as distance from the initialization (i.e., the pretrained network) of the fine-tuned model and noise stability properties of deep networks. This paper identifies a Hessian-based distance measure through PAC-Bayesian analysis, which is shown to correlate well with observed generalization gaps of fine-tuned models. Theoretically, we prove Hessian distance-based generalization bounds for fine-tuned models. We also describe an extended study of fine-tuning against label noise, where overfitting remains a critical problem. We present an algorithm and a generalization error guarantee for this algorithm under a class conditional independent noise model. Empirically, we observe that the Hessian-based distance measure can match the scale of the observed generalization gap of fine-tuned models in practice. We also test our algorithm on several image classification tasks with noisy training labels, showing gains over prior methods and decreases in the Hessian distance measure of the fine-tuned model.

연구 동기 및 목표

  • 미세조정된 딥 네트워크에서 과적합을 이해하고자 하며, 특히 학습 데이터가 적거나 레이블이 노이즈가 있을 경우를 대상으로 한다.
  • 초기화로부터의 거리만으로는 성능을 충분히 반영하지 못하는 데이터 의존적 일반화 측도를 개발하고자 한다.
  • 클래스 조건부 레이블 노이즈 하에서 일반화를 향상시키는 강력한 미세조정 알고리즘을 설계하고자 한다.
  • 헤시안 기반 측도를 패킷-베이지안 분석과 변동 이론을 활용해 이론적으로 정당화하고자 한다.
  • 헤시안 거리 최소화가 일반화와 모델의 강건성 향상에 기여함을 경험적으로 검증하고자 한다.

제안 방법

  • 각 레이어의 가중치에 대한 손실 헤시안을 사용한 헤시안 기반 거리 측도를 제안하며, 이는 $ \sum_{i=1}^{L} \sqrt{ \max_{(x,y)\sim\mathcal{D}} v_i^\top \mathbf{H}_i^+ v_i / n } $ 로 정의된다. 여기서 $ \mathbf{H}_i^+ $ 는 비음수 고유값을 가진 단절된 헤시안이다.
  • 헤시안 기반 거리를 통합한 미세조정된 모델에 대한 패킷-베이지안 일반화 경계를 유도하며, 이는 일반화 오차와 이론적으로 상관관계가 있음을 보여준다.
  • 클래스 조건부 독립 노이즈 모델 하에서 통계적으로 일관된 손실과 레이어별 거리 정규화를 조합한 강력한 미세조정 알고리즘을 도입한다.
  • 전체 헤시안 계산 없이도 효율적으로 헤시안 기반 측도를 추정하기 위해 헤시안-벡터 곱 계산을 활용한다.
  • 크로스 밸리데이션을 통해 하이퍼파ram터를 튜닝하고, 프로그래밍 가능한 레이블 노이즈가 있는 이미지 분류(ResNet-18/101) 및 NLP(RoBERTa-Base) 작업에 이 방법을 적용한다.
  • 레이어별로 스케일링 인자 $ \gamma $ 를 사용하여 혼동 행렬 기반 보정과 정규화 제약 조건을 통합한다.

실험 결과

연구 질문

  • RQ1헤시안 기반 거리 측도가 초기화로부터의 거리 측도만을 사용하는 것보다 미세조정된 딥 네트워크의 일반화 갭을 더 잘 예측할 수 있는가?
  • RQ2일반화 경계에 헤시안 정보를 통합함으로써 미세조정에서 이론적 및 경험적 성능이 향상되는가?
  • RQ3헤시안 인식 정규화 알고리즘이 높은 레이블 노이즈 비율 하에서 과적합을 완화할 수 있는가?
  • RQ4실제로 헤시안 기반 거리 측도가 다른 헤시안 기반 일반화 지표와 비교해 어떻게 성능을 발휘하는가?
  • RQ5헤시안 거리 최소화가 노이즈가 있는 및 표준적인 미세조정 벤치마크에서 모델 정확도를 어느 정도 향상시키는가?

주요 결과

  • 헤시안 기반 거리 측도는 미세조정된 모델에서 관측된 일반화 갭과 강하게 상관관계가 있으며, 기존의 초기화로부터의 거리 측도보다 뛰어난 성능을 보인다.
  • 헤시안 정보를 통합한 제안된 패킷-베이지안 일반화 경계는 이전 경계보다 더 날카롭고 정확한 이론적 보장을 제공한다.
  • 프로그래밍 가능한 레이블 노이즈가 있는 여섯 개의 이미지 분류 작업에서, 이 알고리즘은 기존 방법 대비 평균 상위-1 정확도를 3.26% 향상시켰다.
  • 극단적인 레이블 노이즈 하에서도 이 방법은 안정적인 성능을 유지하며, 클래스 조건부 설정에서 60%의 노이즈 비율에서도 안정성이 확보된다.
  • 헤시안 측도 $ \sqrt{\mathcal{H}/n} $ 는 레이어별 헤시안 측도보다 항상 작으며, 최적화 시 더 나은 일반화 가능성을 시사한다.
  • 경험적 결과로는 모델이 더 잘 일반화할수록 헤시안 거리 측도가 감소함을 확인하였으며, 이는 일반화 오차의 대체 측도로의 활용 가능성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.