[논문 리뷰] Continual Learning via Sequential Function-Space Variational Inference
이 논문은 예측 함수에 대한 베이지안 추론을 수행하는 연속 학습 방법인 순차적 함수공간 변분 추론(s-fsvi)을 제안한다. 이는 네트워크 파라미터가 아닌 예측 함수에 대해 추론을 수행함으로써 더 유연하고 적응 가능한 학습이 가능하며 일반화 성능이 향상된다. s-fsvi는 Split MNIST, Multi-Head CIFAR, Omniglot과 같은 벤치마크 연속 학습 작업에서 최신 기술(SOTA) 성능을 달성하며, 최소한의 또는 무작위로 선택된 코어셋을 요구함으로써 EWC, VCL, FROMP와 같은 기존 방법들을 능가한다.
Sequential Bayesian inference over predictive functions is a natural framework for continual learning from streams of data. However, applying it to neural networks has proved challenging in practice. Addressing the drawbacks of existing techniques, we propose an optimization objective derived by formulating continual learning as sequential function-space variational inference. In contrast to existing methods that regularize neural network parameters directly, this objective allows parameters to vary widely during training, enabling better adaptation to new tasks. Compared to objectives that directly regularize neural network predictions, the proposed objective allows for more flexible variational distributions and more effective regularization. We demonstrate that, across a range of task sequences, neural networks trained via sequential function-space variational inference achieve better predictive accuracy than networks trained with related methods while depending less on maintaining a set of representative points from previous tasks.
연구 동기 및 목표
- 작은 파라미터 변화가 예측에 큰 영향을 미치는 파라미터 공간 정규화의 한계를 해결하기 위해.
- 기존 함수공간 방법이 근사(예: 라플라스 근사)나 선형 모델에 국한되어 있어 유연성이 떨어지는 문제를 해결하기 위해.
- 딥 네URAL 네트워크에 직접 적용 가능한 확장성 있고 민첩한 변분 추론 프레임워크를 개발하기 위해.
- 이전 작업의 정교하게 셋업된 코어셋에 대한 의존도를 줄이면서도 높은 성능을 유지하기 위해.
- 예측 정확도를 희생시키지 않고 효과적인 전진 및 후진 전이를 가능하게 하기 위해.
제안 방법
- 연속 학습을 순차적 함수공간 변분 추론으로 공식화하여, 예측 함수의 사후분포를 작업 간에 점진적으로 갱신한다.
- 의미와 분산 파라미터를 직접 최적화할 수 있는 함수에 대한 변분 가족을 사용하여, 더 높은 민첩성과 정규화 성능을 향상시킨다.
- 이전 작업의 일부 기준점에서 함수에 대한 사전분포와 현재 사후분포가 일치하도록 유도하는 함수공간 정규화 항을 도입한다.
- 파라미터 업데이트와 함수공간 제약을 분리함으로써, 파라미터는 자유롭게 적응하면서도 기능적 지식은 유지할 수 있도록 한다.
- 기준점에서 현재 함수 사후분포와 함수에 대한 사전분포 간의 KL 발산을 최소화하는 동시에 새로운 데이터에 적합하는 변분 목표를 적용한다.
- 스토하스틱 최적화를 사용하여 깊이 있는 베이지안 신경망에 적용함으로써 복잡하고 고차원적인 작업에 대한 확장성을 확보한다.
실험 결과
연구 질문
- RQ1함수공간 변분 추론이 예측 함수 불확실성을 직접 모델링함으로써 파라미터 공간 정규화보다 연속 학습에서 더 뛰어난 성능을 낼 수 있는가?
- RQ2함수공간에서 변분 분산 파라미터를 직접 최적화함으로써 일반화 성능 향상과 기억 상실 감소에 기여하는가?
- RQ3기존의 함수공간 기반 방법과 비교해 볼 때, 이 방법은 코어셋 선택과 크기에 얼마나 민감한가?
- RQ4큰 또는 정교하게 선택된 코어셋에 의존하지 않고 s-fsvi가 얼마나 강력한 전진 및 후진 전이를 달성할 수 있는가?
- RQ5s-fsvi는 다중헤드 및 순차적 작업 설정을 포함한 다양한 연속 학습 벤치마크에서 일반화 가능한가?
주요 결과
- Multi-Head Split CIFAR에서 s-fsvi는 테스트 정확도 77.6%를 달성하여, EWC(71.6%), VCL(67.4%), FROMP(76.2%)를 모두 능가하며 분산이 낮다.
- Split MNIST에서 s-fsvi는 최소한의 코어셋 크기 조건에서도 공동 학습과 유사한 성능을 보이며, VCL 및 EWC보다 뚜렷이 뛰어나다.
- s-fsvi는 강력한 전진 전이(FT = 7.3)와 후진 전이(BT = -2.5)를 보이며, 전진 전이에서는 모든 기준 방법을 능가하고, 후진 전이에서는 EWC 및 FROMP와 동등한 성능을 기록한다.
- 단일 헤드 Split MNIST 벤치마크에서, s-fsvi는 클래스당 하나의 데이터 포인트만을 코어셋으로 사용함으로써, 각 작업당 40개의 포인트를 사용하는 VCL 및 FROMP를 능가한다.
- 무작위로 선택되거나 노이즈가 섞인 코어셋을 사용할 경우에도 s-fsvi는 높은 성능을 유지하며, 코어셋 품질에 대해 거의 민감하지 않다.
- 함수공간 추론에서 VCL 및 EWC보다 항상 뛰어난 성능을 보이며, 지식 전이에 있어 함수공간 정규화가 파라미터공간 정규화보다 더 효과적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.