[논문 리뷰] Prototype-based Incremental Few-Shot Semantic Segmentation
이 논문은 기존의 사전 학습된 세분화 모델에 기반해 이전 데이터에 접근할 수 없고 소수의 레이블이 부여된 이미지만을 사용하여 새로운 클래스를 확장하는 새로운 작업인 Incremental Few-Shot Semantic Segmentation (iFSS)를 소개한다. 제안된 PIFS 방법은 분류기 초기화를 위한 프로토타입 학습, 망각과 과적합을 방지하기 위한 지식 정착, 비i.i.d. 소수 샘플 데이터를 다루기 위한 배치-정규화 기반의 기법을 결합하여 다양한 벤치마크에서 최고 성능을 달성한다.
Semantic segmentation models have two fundamental weaknesses: i) they require large training sets with costly pixel-level annotations, and ii) they have a static output space, constrained to the classes of the training set. Toward addressing both problems, we introduce a new task, Incremental Few-Shot Segmentation (iFSS). The goal of iFSS is to extend a pretrained segmentation model with new classes from few annotated images and without access to old training data. To overcome the limitations of existing models iniFSS, we propose Prototype-based Incremental Few-Shot Segmentation (PIFS) that couples prototype learning and knowledge distillation. PIFS exploits prototypes to initialize the classifiers of new classes, fine-tuning the network to refine its features representation. We design a prototype-based distillation loss on the scores of both old and new class prototypes to avoid overfitting and forgetting, and batch-renormalization to cope with non-i.i.d.few-shot data. We create an extensive benchmark for iFSS showing that PIFS outperforms several few-shot and incremental learning methods in all scenarios.
연구 동기 및 목표
- 대규모 레이블이 부여된 데이터셋이 필요로 하며, 재학습 없이 새로운 클래스에 적응할 수 없는 기존 세분화 모델의 한계를 해결하기 위해.
- 기존 데이터에 접근할 수 없고 소수의 이미지로만 새로운 클래스를 학습하는 실용적인 새로운 학습 시나리오인 Incremental Few-Shot Segmentation (iFSS)를 정의하기 위해.
- 최소한의 감독 신호로 새로운 클래스에 효과적으로 적응하면서도 치명적인 망각을 방지하는 방법을 개발하기 위해.
- 실제 조건에서 기존 및 제안된 방법을 평가하고 비교할 수 있도록 종합적인 iFSS 벤치마크를 설계하기 위해.
제안 방법
- PIFS는 새로운 클래스의 특징 프로토타입을 사용하여 분류기 가중치를 초기화함으로써, 소수 샘플 학습 기간 동안 효과적인 엔드 투 엔드 미세조정을 가능하게 한다.
- 기존 클래스와 신규 클래스의 점수를 동시에 정규화하는 프로토타입 기반 정착 손실을 도입하여 망각과 과적합을 동시에 줄인다.
- 비i.i.d. 소수 샘플 데이터 분포에서의 훈련을 안정화하기 위해 표준 배치 정규화 대신 배치-정규화를 사용한다.
- 프로토타입은 서포트 이미지에서 계산되며, 클래스별 임bedding으로서 특징 학습과 분류를 안내하는 데 사용된다.
- 학생 네트워크(신규 클래스로 미세조정된)와 교사 네트워크(기본 클래스로 사전 학습된) 사이에 지식 정착을 적용하며, 프로토타입을 소프트 타겟으로 사용한다.
- 이 프레임워크는 이전에 학습된 클래스 성능을 유지하면서도 새로운 클래스를 순차적으로 추가함으로써 증강 학습을 지원한다.
실험 결과
연구 질문
- RQ1기존 훈련 데이터에 접근할 수 없고 소수의 레이블이 부여된 이미지만을 사용하여 세분화 모델을 효과적으로 새로운 클래스로 확장할 수 있는가?
- RQ2훈련 중에 이전 클래스 데이터에 접근할 수 없을 때 소수 샘플 세분화에서 치명적인 망각을 어떻게 완화할 수 있는가?
- RQ3세분화에서 비i.i.i.d. 소수 샘플 데이터 분포에 가장 효과적인 훈련 기법은 무엇인가?
- RQ4프로토타입 기반 초기화와 지식 정착을 결합하면 소수 샘플 일반화 및 증강 학습 성능을 향상시킬 수 있는가?
- RQ5이전 클래스 픽셀이 배경으로 레이블링되는 배경 이동 현상이 모델 성능에 미치는 영향은 무엇이며, 이를 어떻게 해결할 수 있는가?
주요 결과
- PIFS는 VOC 및 COCO 벤치마크의 모든 iFSS 설정에서 평균 교차율(mIoU)을 최고로 기록하며, 기존의 증강 학습 및 소수 샘플 학습 방법들을 모두 초월한다.
- 배경 이동이 있는 단일 스텝 설정에서 PIFS* (개선된 교차 엔트로피 손실 사용)는 VOC에서 최고의 IL 방법보다 2.7% 높은 조화 평균(HM) mIoU를 기록했으며, COCO에서는 4% 높았다.
- PIFS*는 PIFS 대비 VOC에서 mIoU-B(배경 클래스)를 1.7% 향상시켰고, COCO에서는 4.7% 향상시켜 배경 이동 모델링의 유용성을 입증했다.
- 표준 배치 정규화 대비 배치-정규화를 사용함으로써 성능이 크게 향상되었으며, 이는 비i.i.d. 소수 샘플 데이터에서 표준 배치 정규화가 성능을 저하시키기 때문이다.
- 신규 클래스 프로토타입에만 의존하는 방법들(예: DWI)은 VOC에서 평균 HM 기준으로 PIFS보다 5.7% 떨어졌고, COCO에서는 2.5% 떨어져, 병합 정착의 우수성을 보여주었다.
- SPN은 배경 이동을 처리하지 못해 낮은 mIoU-B 점수를 기록했지만, PIFS*는 VOC에서 6% 높고 COCO에서는 2.7% 높은 성능을 기록하여 적절한 배경 모델링의 중요성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.