[논문 리뷰] Zero-Shot Semantic Segmentation
이 논문은 훈련 예제 없이도 새로운 객체 카테고리의 픽셀을 분류할 수 있도록 하는 새로운 작업인 제로샷 세그멘테이션(ZS3)을 소개한다. 제안된 ZS3Net 아키텍처는 생성 모델을 통해 시각적 및 텍스트 임베딩을 융합하여 새로운 클래스의 특징을 합성하고, 자체 훈련과 그래프-컨텍스트 인코딩을 통해 성능을 향상시킨다. 이로 인해 Pascal-VOC 및 Pascal-Context 데이터셋에서 최대 10개의 새로운 클래스를 포함한 거의 지도 학습 성능을 달성한다.
Semantic segmentation models are limited in their ability to scale to large numbers of object classes. In this paper, we introduce the new task of zero-shot semantic segmentation: learning pixel-wise classifiers for never-seen object categories with zero training examples. To this end, we present a novel architecture, ZS3Net, combining a deep visual segmentation model with an approach to generate visual representations from semantic word embeddings. By this way, ZS3Net addresses pixel classification tasks where both seen and unseen categories are faced at test time (so called "generalized" zero-shot classification). Performance is further improved by a self-training step that relies on automatic pseudo-labeling of pixels from unseen classes. On the two standard segmentation datasets, Pascal-VOC and Pascal-Context, we propose zero-shot benchmarks and set competitive baselines. For complex scenes as ones in the Pascal-Context dataset, we extend our approach by using a graph-context encoding to fully leverage spatial context priors coming from class-wise segmentation maps.
연구 동기 및 목표
- 추론 시 새로운, 미리 보지 않은 객체 카테고리로 일반화할 수 없는 세그멘테이션 모델의 한계를 해결하기 위해.
- 훈련 예제 없이도 의미적 설명만을 사용하여 새로운 객체 카테고리의 픽셀 단위 분류를 가능하게 하기 위해.
- 미리 보지 않은 클래스의 레이블이 없는 픽셀을 활용한 자체 훈련을 통해 제로샷 세그멘테이션 성능을 향상시키기 위해.
- 그래프-컨텍스트 인코딩을 통한 공간적 컨텍스트 사전 지식을 활용하여 복잡한 시나리오에서의 인식 성능을 향상시키기 위해.
제안 방법
- ZS3Net은 깊이 있는 시각적 세그멘테이션 백본과 새로운 클래스를 위한 시각적 특징 공간으로 의미어 임베딩을 매핑하는 생성 모델을 결합한다.
- 모델는 시각적-텍스트 임베딩 공간을 공동으로 사용하며, 의미적 유사성이 공간적 근접성으로 번역되어 제로샷 전이가 가능하게 한다.
- 자기 훈련 단계에서는 훈련 중에 새로운 클래스의 고신뢰도 픽셀에 대해 의사 레이블을 자동으로 생성하여 일반화 성능을 향상시킨다.
- 그래프-컨텍스트 인코딩은 객체 클래스 간의 공간적 관계를 모델링하여, 복잡한 시나리오에서 특징 표현을 향상시킨다.
- 이 프레임워크는 일반화된 제로샷 러닝을 지원하며, 테스트 시 볼 수 있는 클래스와 볼 수 없는 클래스가 모두 존재한다.
- 모델 훈련은 볼 수 있는 클래스에 대한 지도 학습 손실과 생성된 볼 수 없는 클래스 특징에 기반한 합성 지도 학습 손실을 결합한다.
실험 결과
연구 질문
- RQ1훈련 중에 본 적이 없는 객체 카테고리를 인식하도록 세그멘테이션 모델을 훈련시킬 수 있는가?
- RQ2의미어림베딩에서 효과적으로 새로운 클래스의 시각적 특징을 생성할 수 있는가?
- RQ3미리 보지 않은 클래스의 의사라벨이 부여된 픽셀을 활용한 자체 훈련이 제로샷 세그멘테이션 성능에 얼마나 기여하는가?
- RQ4객체 동시 발생 패턴과 같은 공간적 컨텍스트 사전 지식이 복잡한 시나리오에서 제로샷 세그멘테이션 성능을 어떻게 향상시키는가?
주요 결과
- Pascal-VOC에서 2개의 새로운 클래스를 포함할 경우, ZS3Net은 평균 IoU 75.7을 기록했으며, 지도 학습 기준선 76.1에 매우 가까운 성능을 달성했다.
- 자기 훈련을 적용한 ZS5Net을 사용할 경우, Pascal-VOC에서 2개의 새로운 클래스를 포함한 전체 조합에서 조화 평균 IoU가 75.7에 도달했으며, 지도 학습 성능과 동일했다.
- Pascal-Context에서 2개의 새로운 클래스를 포함할 경우, ZS5Net은 조화 평균 IoU 47.7을 기록했으며, ZSL 기준선을 크게 뛰어넘었다.
- 그래프-컨텍스트 인코딩은 Pascal-Context에서 모든 새로운 클래스 분할에 대해 일관되게 mIoU를 향상시켜 ZS3Net의 성능을 향상시켰다.
- Pascal-VOC에서 25%의 고신뢰도 새로운 클래스 픽셀, Pascal-Context에서 75%의 고신뢰도 새로운 클래스 픽셀을 활용한 자기 훈련이 최적의 성능을 냈으며, 새로운 클래스의 mIoU가 최대 10% 향상되었다.
- 정성적 결과에서는 ZS5Net이 '오토바이'와 '소'와 같은 이전에 훈련되지 않은 객체를 성공적으로 세그멘테이션하는 반면, 기준 모델은 이를 보다 보편적인 클래스의 혼합물로 잘못 분류하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.