Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Better Plasticity-Stability Trade-off in Incremental Learning: A Simple Linear Connector

Guoliang Lin, Hanglu Chu|arXiv (Cornell University)|2021. 10. 15.
Domain Adaptation and Few-Shot Learning참고 문헌 37인용 수 4
한 줄 요약

이 논문은 이전 작업의 안정성을 확보하기 위한 노르멀스페이스 프로젝션 네트워크와 현재 작업의 유연성을 극대화하기 위한 표준 SGD 훈련 네트워크를 조합하는 단순한 선형 커넥터를 제안한다. 이는 과거 데이터를 저장하지 않고도 데이터 프리 인크리멘탈 러닝에서 최고의 성능을 달성한다. 이 방법은 과거 데이터를 저장하지 않고도 유연성-안정성 딜레마를 개선하며, 10분할-CIFAR-100에서 79.79%의 정확도와 25분할-TinyImageNet에서 64.61%의 정확도를 기록하여, Adam-NSCL과 같은 이전 방법들을 능가한다.

ABSTRACT

Plasticity-stability dilemma is a main problem for incremental learning, where plasticity is referring to the ability to learn new knowledge, and stability retains the knowledge of previous tasks. Many methods tackle this problem by storing previous samples, while in some applications, training data from previous tasks cannot be legally stored. In this work, we propose to employ mode connectivity in loss landscapes to achieve better plasticity-stability trade-off without any previous samples. We give an analysis of why and how to connect two independently optimized optima of networks, null-space projection for previous tasks and simple SGD for the current task, can attain a meaningful balance between preserving already learned knowledge and granting sufficient flexibility for learning a new task. This analysis of mode connectivity also provides us a new perspective and technology to control the trade-off between plasticity and stability. We evaluate the proposed method on several benchmark datasets. The results indicate our simple method can achieve notable improvement, and perform well on both the past and current tasks. On 10-split-CIFAR-100 task, our method achieves 79.79% accuracy, which is 6.02% higher. Our method also achieves 6.33% higher accuracy on TinyImageNet. Code is available at https://github.com/lingl1024/Connector.

연구 동기 및 목표

  • 과거 데이터를 저장하지 않고도 인크리멘탈 러닝에서의 유연성-안정성 딜레마를 해결하기 위해.
  • 이전 작업의 지식 유지를 유지하면서도 새로운 작업의 학습 능력을 극대화할 수 있는 방법을 개발하기 위해.
  • 손실 곡면에서의 모드 연결성을 활용하여 독립적으로 최적화된 네트워크 최소값을 연결하기 위해.
  • 기존의 리허설 및 정규화 기반 방법의 샘플 프리 이론적 대안을 제공하기 위해.
  • 최소한의 아키텍처나 훈련 복잡도로 벤치마크 데이터셋에서 뛰어난 성능을 달성하기 위해.

제안 방법

  • 이전 작업의 지식을 유지하기 위해 노르멀스페이스 프로젝션을 사용해 첫 번째 네트워크를 훈련한다.
  • 현재 작업에서 최대한의 유연성을 확보하기 위해 표준 SGD로 두 번째 네트워크를 훈련한다.
  • 학습 가능한 가중치 β를 사용해 두 네트워크를 평균하여 선형 커넥터를 구성한다.
  • 이론적 분석을 통해 선형 경로가 모든 작업의 경험적 손실에 대한 상한을 최소화함을 보여준다.
  • 과거 데이터를 저장하지 않아도 되므로 데이터 프리 IL 제약 조건을 충족한다.
  • 안정성과 유연성의 균형을 이루는 간단한 평균화 기반 최적화 방법을 통해 커넥터를 최적화한다.

실험 결과

연구 질문

  • RQ1과거 데이터 없이도 두 개의 독립적으로 훈련된 네트워크 최소값 사이의 선형 경로가 인크리멘탈 러닝에서 높은 성능을 달성할 수 있는가?
  • RQ2손실 곡면에서의 모드 연결성을 어떻게 활용하여 유연성-안정성 딜레마를 개선할 수 있는가?
  • RQ3데이터 프리 IL에서 안정성(지식 유지)과 유연성(새로운 작업 학습) 사이의 최적 균형은 무엇인가?
  • RQ4안정성 전용 네트워크와 유연성 전용 네트워크를 단순히 평균화한 방법이 복잡한 정규화나 리허설 방법을 능가할 수 있는가?
  • RQ5제안된 방법은 치명적인 잊음 없이 모든 작업, 특히 이전 작업의 정확도를 유지할 수 있는가?

주요 결과

  • 제안된 방법은 10분할-CIFAR-100 벤치마크에서 79.79%의 정확도를 달성하여 이전 방법보다 6.02% 향상되었다.
  • 20분할-CIFAR-100에서 방법은 80.80%의 정확도를 기록했으며, Adam-NSCL보다 4.85% 높았다.
  • 25분할-TinyImageNet에서 방법은 64.61%의 정확도를 기록했으며, 베이스라인보다 6.33% 향상되었다.
  • 이 방법은 더 나은 유연성-안정성 균형을 달성했으며, BWT는 -0.92(Adam-NSCL의 -1.6 대비)이고, Intransigence Measure는 8.10(14.50 대비)로, 더 뛰어난 유연성을 보였다.
  • 제거 분석 결과, 모든 데이터셋에서 β ≈ 1/t가 안정성과 유연성 사이의 최적 균형을 제공하는 것으로 확인되었다.
  • 두 네트워크 사이의 선형 경로는 급격한 하락 없이 부드러운 정확도 전이를 보이며, 커넥터를 따라 안정적인 일반화가 이루어짐을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.