[논문 리뷰] Learning Non-target Knowledge for Few-shot Semantic Segmentation
이 논문은 PASCAL-5i 및 COCO-20i 벤치마크에서 최고 성능을 기록하는 새로운 소수의 시각적 세그멘테이션 프레임워크인 NTRENet를 제안한다. 이 방법은 쿼리 이미지의 배경(BG) 및 혼란스러운 물체(DO) 영역을 명시적으로 탐색하고 제거하여 정확도를 향상시킨다. BG 마이닝 모듈, 새로운 BG 손실, BG/DO 제거 모듈, 그리고 원형 대비 학습을 도입함으로써, 잘못된 양성 결과를 줄이고 소수의 시각적 세그멘테이션에서 최신 기술 수준(SOTA)을 달성한다.
Existing studies in few-shot semantic segmentation only focus on mining the target object information, however, often are hard to tell ambiguous regions, especially in non-target regions, which include background (BG) and Distracting Objects (DOs). To alleviate this problem, we propose a novel framework, namely Non-Target Region Eliminating (NTRE) network, to explicitly mine and eliminate BG and DO regions in the query. First, a BG Mining Module (BGMM) is proposed to extract the BG region via learning a general BG prototype. To this end, we design a BG loss to supervise the learning of BGMM only using the known target object segmentation ground truth. Then, a BG Eliminating Module and a DO Eliminating Module are proposed to successively filter out the BG and DO information from the query feature, based on which we can obtain a BG and DO-free target object segmentation result. Furthermore, we propose a prototypical contrastive learning algorithm to improve the model ability of distinguishing the target object from DOs. Extensive experiments on both PASCAL-5i and COCO-20i datasets show that our approach is effective despite its simplicity.
연구 동기 및 목표
- 소수의 시각적 세그멘테이션에서 배경 및 혼란스러운 물체 영역에서 높은 오진률을 해결하기 위해.
- 단지 목표 물체의 특징 학습을 향상시키는 데에 국한되지 않고, 비목표 영역을 제거하는 데에 초점을 맞춘 새로운 패러다임을 제안하기 위해.
- 배경(BG) 지도 데이터가 필요 없이 일반적인 BG 프로토타입을 학습할 수 있는 BG 마이닝 모듈(BGMM)을 개발하기 위해.
- 쿼리 특징에서 비목표 특징을 걸러내기 위해 BG 및 DO 제거 모듈(BGEM, DOEM)을 설계하기 위해.
- 목표 물체와 DO 간의 특징 구별 능력을 향상시키기 위해 원형 대비 학습(PCL)을 활용하기 위해.
제안 방법
- BG 마이닝 모듈(BGMM)은 새로운 BG 손실을 사용하여 쿼리 및 서포트 이미지에서 일반적인 BG 프로토타입을 학습한다. 이 손실은 목표 물체 마스크만을 사용하여 훈련된다.
- BG 손실은 BG 프로토타입이 목표 물체 특징과 구별되도록 강제함으로써, BG 지도 데이터가 없더라도 BG 영역 예측이 가능하도록 한다.
- BG 제거 모듈(BGEM)은 쿼리 특징을 학습된 BG 프로토타입과 매칭시켜 쿼리에서 BG 특징을 억제한다.
- DO 제거 모듈(DOEM)은 서포트 이미지에서 유도된 DO 프로토타입과 쿼리 특징을 비교하여 DO 영역을 식별하고 제거한다.
- 원형 대비 학습(PCL)은 프로토타입 임베딩을 정교화하며, 목표 프로토타입을 양성 샘플로, DO 프로토타입을 어려운 음성 샘플로 간주한다.
- 최종 세그멘테이션은 정교화된 목표 프로토타입을 BG 및 DO가 제거된 쿼리 특징과 매칭시켜 생성된다.
실험 결과
연구 질문
- RQ1비목표 영역(BG 및 DO)을 명시적으로 탐색하고 제거하는 것이 소수의 시각적 세그멘테이션 성능을 향상시키는가?
- RQ2BG 지도 데이터 마스크에 접근할 수 없을 때 일반적인 BG 프로토타입을 어떻게 학습할 수 있는가?
- RQ3BG 및 DO 특징을 제거함으로써 오진 예측를 줄이는 데 어떤 영향을 미치는가?
- RQ4DO 프로토타입이 대비 학습에서 목표 물체 식별을 위한 어려운 음성 샘플로 얼마나 효과적인가?
- RQ5일반화 능력과 표현 능력의 균형을 고려할 때 BG 프로토타입에 최적의 채널 차원은 무엇인가?
주요 결과
- NTRENet의 전체 모델은 1-shot 설정에서 PASCAL-5i에서 평균 mIoU 64.2%를 기록하여 이전의 최고 성능 기준을 초월한다.
- BGEM을 통해 BG 영역을 제거함으로써, 목표 프로토타입만을 사용하는 기준 모델 대비 4%의 mIoU 향상을 달성한다.
- DOEM을 추가하여 DO 영역을 제거함으로써 추가로 2%의 mIoU 향상이 발생하여 오진 예측 감소에 효과적임을 입증한다.
- PCL 모듈은 목표 물체와 DO 간의 특징 구별 능력을 향상시켜 추가로 1%의 mIoU 향상을 기여한다.
- 기준 모델 대비 정밀도가 3% 향상되었으며, 각 구성 요소(BGEM, DOEM, PCL)가 점진적으로 오진 예측을 감소시킨다.
- BG 프로토타입에 640채널을 사용할 경우 전체 성능이 최고로 나타나며, 일부 폴드에서는 512채널이 최적의 성능을 낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.