Skip to main content
QUICK REVIEW

[논문 리뷰] RIFLE: Backpropagation in Depth for Deep Transfer Learning through Re-Initializing the Fully-connected LayEr

Xingjian Li, Haoyi Xiong|arXiv (Cornell University)|2020. 07. 07.
Domain Adaptation and Few-Shot Learning인용 수 11
한 줄 요약

RIFLE는 깊이 있는 컨volution 신경망(CNN)의 백프로파게이션을 향상시키기 위해 미세조정 중에 완전히 연결된(FC) 레이어를 주기적으로 무작위 가중치로 재초기화하는 새로운 정규화 기법이다. 이 기법은 깊은 층에 의미 있는 기울기 업데이트를 주입함으로써 저수준 특징 학습을 향상시키며, 동일한 설정에서 최신 기법인 드롭아웃, 드롭아웃 커넥션, 순환 학습률보다 0.5%~2% 높은 테스트 정확도를 달성한다.

ABSTRACT

Fine-tuning the deep convolution neural network(CNN) using a pre-trained model helps transfer knowledge learned from larger datasets to the target task. While the accuracy could be largely improved even when the training dataset is small, the transfer learning outcome is usually constrained by the pre-trained model with close CNN weights (Liu et al., 2019), as the backpropagation here brings smaller updates to deeper CNN layers. In this work, we propose RIFLE - a simple yet effective strategy that deepens backpropagation in transfer learning settings, through periodically Re-Initializing the Fully-connected LayEr with random scratch during the fine-tuning procedure. RIFLE brings meaningful updates to the weights of deep CNN layers and improves low-level feature learning, while the effects of randomization can be easily converged throughout the overall learning procedure. The experiments show that the use of RIFLE significantly improves deep transfer learning accuracy on a wide range of datasets, out-performing known tricks for the similar purpose, such as Dropout, DropConnect, StochasticDepth, Disturb Label and Cyclic Learning Rate, under the same settings with 0.5% -2% higher testing accuracy. Empirical cases and ablation studies further indicate RIFLE brings meaningful updates to deep CNN layers with accuracy improved.

연구 동기 및 목표

  • 완전히 연결된(FC) 레이어의 빠른 수렴으로 인해 백프로파게이션의 의미 있는 업데이트가 깊은 컨volution 신경망(CNN) 레이어에 전달되지 못하는 딥 트랜스퍼 러닝의 한계를 해결하기 위해.
  • 더 깊은 네트워크 레이어로의 효과적인 오차 백프로파게이션을 가능하게 하여 트랜스퍼 러닝에서 저수준 특징 학습을 향상시키기 위해.
  • 모델 수렴에 영향을 주지 않으면서 지식 전이를 향상시키는 단순하면서도 효과적인 정규화 전략을 제안하기 위해.
  • 빠르게 수렴하는 FC 레이어를 가진 사전 훈련된 모델을 사용할 때 발생하는 과적합 및 부적절한 가중치 업데이트 문제를 해결하기 위해.
  • 통제된 무작위화를 통해 사전 훈련된 지식을 유지하면서도 타겟 데이터셋에 충분히 적응할 수 있도록 하는 균형을 이루기 위해.

제안 방법

  • 미세조정 과정을 동일한 기간으로 나누고, 각 기간의 시작 시점에 완전히 연결된(FC) 레이어를 무작위 가중치로 재초기화한다.
  • 재초기화와 동기화된 순환 학습률 스케줄을 적용하여 전체 훈련 과정에서 안정적인 수렴을 보장한다.
  • 특히 FC 레이어만 재초기화하여 사전 훈련된 컨volution 필터를 유지하면서 더 깊은 기울기 흐름을 가능하게 한다.
  • 재초기화는 훈련 동역학에 의미 있는 변화를 유도하여 사전 훈련된 가중치에 의해 유도된 국소 최소값에서 벗어나도록 돕는다.
  • 이 방법은 경량이며 기존 딥 러닝 프레임워크와 호환되며, 최소한의 아키텍처 변경이 필요하다.
  • 통제된 노이즈를 통해 랜덤 재초기화를 통합함으로써 과적합을 방지하면서도 전체 훈련 안정성을 유지한다.

실험 결과

연구 질문

  • RQ1완전히 연결된 레이어의 주기적 재초기화가 트랜스퍼 러닝에서 더 깊은 컨volution 레이어로의 기울기 흐름을 향상시킬 수 있는가?
  • RQ2기본적인 미세조정과 달리, 고정된 FC 가중치를 사용하는 것보다 FC 레이어를 재초기화하는 것이 저수준 특징 학습을 더 잘 향상시키는가?
  • RQ3RIFLE는 드롭아웃, 드롭아웃 커넥션, 스토하스틱 디pth와 같은 기존 정규화 기법보다 딥 트랜스퍼 러닝 정확도에서 뛰어나게 성능을 낼 수 있는가?
  • RQ4훈련 중에 RIFLE는 다양한 네트워크 레이어에서 기울기의 크기와 분포에 어떤 영향을 미치는가?
  • RQ5RIFLE는 원본 데이터셋의 특징에 대한 의존도를 어느 정도 줄이고 타겟 데이터셋에 대한 적응을 향상시키는가?

주요 결과

  • 동일한 설정에서 RIFLE는 기본적인 미세조정 및 드롭아웃, 드롭아웃 커넥션, 순환 학습률과 같은 알려진 정규화 기법보다 테스트 정확도를 0.5%~2% 향상시킨다.
  • 재초기화 이후에 깊은 레이어의 기울기 크기가 주기적으로 재활성화되어 기존의 미세조정에서 관찰되는 조기 기울기 소멸 현상을 방지한다.
  • RIFLE 하에서 깊은 레이어의 기울기 프로베니우스 노름은 순수한 L² 정규화보다 유의미하게 높게 유지되며, 지속적인 백프로파게이션을 나타낸다.
  • 실험 분석 결과, RIFLE는 진짜 오라클에 가까운 저수준 특징을 학습하며, 학습된 가중치와 진짜 가중치 간의 최적 운반 거리가 14% 감소한다.
  • MLP 오라클 실험에서 기준값(1.16×10⁻²) 대비 더 낮은 테스트 손실(3.98×10⁻³)을 기록함으로써 과적합 없이 더 나은 일반화 성능을 달성한다.
  • 제거 분석 결과, 성능 향상은 하이퍼파ram터 튜닝이 아니라 더 깊은 백프로파게이션 덕분임을 확인하였으며, 동일한 학습률과 아키텍처를 사용하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.