Skip to main content
QUICK REVIEW

[논문 리뷰] Overcoming Multi-Model Forgetting

Yassine Benyahia, Kaicheng Yu|ArXiv.org|2019. 02. 21.
Domain Adaptation and Few-Shot Learning인용 수 12
한 줄 요약

이 논문은 다중 모델의 기각을 줄이는 통계적으로 모otivated된 정규화 방법인 웨이트 플라스티시티 손실(Weight Plasticity Loss, WPL)을 소개한다. 이는 순차적 훈련 중 공유 파라미터 업데이트로 인해 이전에 훈련된 모델의 성능 저하를 완화한다. WPL은 이전 모델에 대한 공유 가중치의 중요도에 따라 학습률을 동적으로 조정함으로써, 엄격한 수렴 조건에서는 최대 99%까지, 느슨한 수렴 조건에서는 52%까지 기각을 감소시킨다. 특히 신경망 아키텍처 탐색(NAS)에서 뛰어난 성능을 보이며, PTB 데이터셋에서 WPL 없이 65.01인 퍼플렉서티를 61.9로 개선한다.

ABSTRACT

We identify a phenomenon, which we refer to as multi-model forgetting, that occurs when sequentially training multiple deep networks with partially-shared parameters; the performance of previously-trained models degrades as one optimizes a subsequent one, due to the overwriting of shared parameters. To overcome this, we introduce a statistically-justified weight plasticity loss that regularizes the learning of a model's shared parameters according to their importance for the previous models, and demonstrate its effectiveness when training two models sequentially and for neural architecture search. Adding weight plasticity in neural architecture search preserves the best models to the end of the search and yields improved results in both natural language processing and computer vision tasks.

연구 동기 및 목표

  • 공유 파라미터 업데이트로 인해 이전에 훈련된 모델의 성능 저하가 발생하는 다중 모델 기각 문제를 해결한다.
  • 공유 레이어의 수가 많아질수록 성능 저하가 증가하며, 특히 파라미터 공유를 통한 순차적 훈련에서 두드러진다는 점을 규명한다.
  • 이전에 학습된 지식을 보존하기 위해 파라미터 중요도에 기반한 학습 동역학 조정을 통한 통계적으로 타당한 정규화 방법을 제안한다.
  • WPL이 엄격한 수렴 및 느슨한 수렴 조건 모두에서 효과적임을 입증하며, 특히 신경망 아키텍처 탐색(NAS) 파이프라인에서의 성능 향상을 보여준다.
  • 기각을 줄임으로써, 철저한 하이퍼파rameter 튜닝 없이도 자연어 처리 및 컴퓨터 비전 작업에서 최종 모델 성능을 향상시킬 수 있음을 보여준다.

제안 방법

  • 약한 가정 하에 훈련 데이터를 기반으로 공유 및 전용 파라미터의 사후 확률을 최대화하는 학습 목표를 수립한다.
  • 이전에 훈련된 모델에 대한 중요도에 비례하여 공유 파라미터 업데이트를 정규화하는 웨이트 플라스티시티 손실(WPL)을 유도한다.
  • 파라미터 중요도를 피셔 정보를 사용해 추정함으로써, 이전 모델에 핵심적인 중요한 가중치의 업데이트 속도를 늦출 수 있도록 한다.
  • 모델을 한 번에 하나씩 순차적으로 훈련하는 프레임워크에서 WPL를 적용하며, 각 단계에서 공유 레이어를 업데이트한다.
  • 웨이트 공유를 통해 탐색 속도를 높이는 ENAS 및 NAO와 같은 NAS 방법에 WPL를 통합한다.
  • 다양한 탐색 설정에서 WPL의 강건성과 일반화 능력을 평가하기 위해 NAS 실험에서 출력 드롭아웃 및 경로 드롭 전략을 적용한다.

실험 결과

연구 질문

  • RQ1공유 파라미터를 가진 순차적 훈련 모델에서 다중 모델 기각이 성능 저하에 얼마나 큰 영향을 미치는가?
  • RQ2통계적으로 타당한 정규화 방법이 공유 파라미터 환경에서 기각을 줄이면서도 훈련 효율성을 유지할 수 있는가?
  • RQ3신경망 아키텍처 탐색에서, 특히 느슨한 수렴 환경에서 WPL가 기각을 얼마나 효과적으로 줄이는가?
  • RQ4기본 NAS 방법에 비해 WPL가 언어 모델링 및 이미지 분류와 같은 최종 작업에서 최종 모델 정확도를 향상시키는가?
  • RQ5다양한 드롭아웃 비율과 가중치 공유 전략을 가진 ENAS 및 NAO와 같은 다른 NAS 프레임워크에서도 WPL가 일반화 가능한가?

주요 결과

  • 모델 A가 완전히 수렴하도록 훈련된 경우, WPL는 다중 모델 기각을 최대 99%까지 감소시켜, 이후 모델 B 훈련 중에도 성능을 크게 유지한다.
  • 더 현실적인 느슨한 수렴 조건에서는 WPL가 기각을 52% 감소시켜 실제 훈련 시나리오에서의 강건성을 입증한다.
  • ENAS를 사용한 신경망 아키텍처 탐색에서, WPL는 영향을 가장 많이 받는 모델에 대해 51%의 기각 감소를, 모든 샘플링된 모델 평균으로는 95%의 기각 감소를 기록한다.
  • WPL를 사용해 찾은 최종 최적 아키텍처는 PTB 언어 모델링 데이터셋에서 퍼플렉서티 61.9를 기록하며, ENAS(65.01)를 뛰어넘고, 철저한 하이퍼파rameter 튜닝 없이도 ENAS*(63.26)를 초월한다.
  • CIFAR10 이미지 분류에서 WPL는 상위-1 오차를 ENAS의 4.87%에서 3.81%로 감소시켜, 자연어 처리와 컴퓨터 비전 작업 전반에서 일관된 성능 향상을 보인다.
  • WPL는 ENAS 및 NAO와 같은 다른 NAS 방법으로도 효과적으로 일반화되며, 다양한 드롭아웃 비율과 훈련 전략(특히 공격적인 경로 드롭 전략 포함)에서도 기각 감소 효과를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.