[논문 리뷰] Prior Guided Feature Enrichment Network for Few-Shot Segmentation
PFENet은 고수준 특징에서 training-free prior mask를 생성하고 Feature Enrichment Module을 통해 지원 정보와 쿼리 특징을 적응적으로 융합하여 추가 학습 비용 없이 PASCAL-5i와 COCO에서 최신 수준의 few-shot segmentation 성능을 달성합니다.
State-of-the-art semantic segmentation methods require sufficient labeled data to achieve good results and hardly work on unseen classes without fine-tuning. Few-shot segmentation is thus proposed to tackle this problem by learning a model that quickly adapts to new classes with a few labeled support samples. Theses frameworks still face the challenge of generalization ability reduction on unseen classes due to inappropriate use of high-level semantic information of training classes and spatial inconsistency between query and support targets. To alleviate these issues, we propose the Prior Guided Feature Enrichment Network (PFENet). It consists of novel designs of (1) a training-free prior mask generation method that not only retains generalization power but also improves model performance and (2) Feature Enrichment Module (FEM) that overcomes spatial inconsistency by adaptively enriching query features with support features and prior masks. Extensive experiments on PASCAL-5$^i$ and COCO prove that the proposed prior generation method and FEM both improve the baseline method significantly. Our PFENet also outperforms state-of-the-art methods by a large margin without efficiency loss. It is surprising that our model even generalizes to cases without labeled support samples. Our code is available at https://github.com/Jia-Research-Lab/PFENet/.
연구 동기 및 목표
- few-shot segmentation에서 기본 클래스에 대해 학습된 고수준 특징에 과도하게 의존함으로써 발생하는 일반화 손실의 해결.
- adaptive feature enrichment를 통해 쿼리와 지원 대상 간의 공간적 불일치 완화.
- 일반화에 해를 끼치지 않으면서 segmentation을 안내할 수 있는 고수준 특징을 이용한 training-free prior mask 생성기 개발.
- 다중 스케일 Feature Enrichment Module (FEM)을 도입하여 지원 특징과 프라이어를 across scales로 결합하여 쿼리 특징을 정제.
- 효율적인 모델로 표준 벤치마크에서 최첨단 성능을 시연하고 ablation을 통해 구성요소 분석.
제안 방법
- ImageNet 사전 학습된 고수준 특징을 이용해 쿼리 및 지원 특징 간의 최대 코사인 유사도 값을 이용해 픽셀 단위의 prior mask YQ를 생성하는 training-free prior generation 제안 및 정규화.
- FEM은 (i) 다중 스케일에서 쿼리, 지원, prior를 합치는 inter-source 강화; (ii) 상향 정보 경로를 통한 inter-scale 상호 작용으로 미세 스케일 정보를 거친 스케일로 전달; (iii) 스케일 간 정보를 정제된 쿼리 특징으로 집중시키고 중간 감독으로 학습을 돕는 방식으로 구성.
- PFENet 아키텍처에 prior generation과 FEM을 통합하고 backbones를 공유하여 지원 및 쿼리의 중간 수준 특징을 추출하고 고수준 특징으로 priors를 생성.
- 채널 축소를 위한 1x1 컨볼루션, FEM 입력 생성을 위한 다중 스케일 풀링, 픽셀 단위 예측을 위한 최종 분류 헤드를 사용.
- 교차 엔트로피 손실로 학습하되 FEM 스케일의 중간 손실과 최종 손실을 결합하는 균형 계수로 백본 파라미터를 업데이트하지 않는 방식으로 학습.
실험 결과
연구 질문
- RQ1학습 없이도 고수준 특징 프라이어가 few-shot segmentation의 보지 못한 클래스에 대한 일반화를 향상시킬 수 있는가?
- RQ2multi-scale Feature Enrichment Module이 쿼리와 지원 샘플 간의 공간 불일치를 효과적으로 해결하는가?
- RQ3고수준 프라이어와 FEM이 표준 few-shot segmentation 벤치마크의 성능을 향상시키는 방식은 무엇인가?
- RQ4PFENet이 효율성과 일반화를 유지하면서 PASCAL-5i와 COCO에서 기존 방법보다 우수한 성능을 달성할 수 있는가?
- RQ5레이블이 있는 지원 샘플이 거의 없거나 없는 설정에서도 일반화가 가능한가?
주요 결과
- PFENet은 효율성 손실 없이 PASCAL-5i와 COCO에서 최첨단 결과를 달성합니다.
- 학습-free priors 생성은 일반화를 보존하고 고수준 특징을 클래스에 영향받지 않는 방식으로 활용하여 segmentation 정확도를 높입니다.
- FEM은 조건부 간-스케일 및 간-소스 상호 작용을 가능하게 하여 전통적인 다중 스케일 구조(PPM, ASPP)에 비해 우수한 이득을 제공합니다.
- PFENet은 학습 가능한 파라미터가 매우 적은 모델에서도 강력한 성능을 보이며, VGG 기반 모델은 10.4M, ResNet 기반 모델은 10.8M까지 가능
- 레이블이 있는 지원 샘플이 전혀 없거나 매우 제한적인 시나리오에서도 프라이어 및 강화 접근법의 견고함을 강조하는 의미 있는 성능을 보입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.