Skip to main content
QUICK REVIEW

[논문 리뷰] Conterfactual Generative Zero-Shot Semantic Segmentation

Feihong Shen, Jun Liu|arXiv (Cornell University)|2021. 06. 11.
Domain Adaptation and Few-Shot Learning참고 문헌 36인용 수 7
한 줄 요약

이 논문은 본문에서 다루는 클래스와 볼 수 없는 클래스 사이의 편향을 줄이기 위해 인과관계를 모델링함으로써 임의의 통계적 상관관계를 피하는, 제로샷 세분화를 위한 반사적 생성 프레임워크를 제안한다. 반사적 특징을 생성하고 인과적 훈련 전략을 적용함으로써, 이 방법은 볼 수 없는 클래스에서 mIoU를 24% 향상시키고 본문에서 다룬 클래스에서 19% 향상시키며, 기존의 생성 모델보다 성능이 뛰어나면서도 GCN과 같은 보조 구조와도 호환된다.

ABSTRACT

zero-shot learning is an essential part of computer vision. As a classical downstream task, zero-shot semantic segmentation has been studied because of its applicant value. One of the popular zero-shot semantic segmentation methods is based on the generative model Most new proposed works added structures on the same architecture to enhance this model. However, we found that, from the view of causal inference, the result of the original model has been influenced by spurious statistical relationships. Thus the performance of the prediction shows severe bias. In this work, we consider counterfactual methods to avoid the confounder in the original model. Based on this method, we proposed a new framework for zero-shot semantic segmentation. Our model is compared with baseline models on two real-world datasets, Pascal-VOC and Pascal-Context. The experiment results show proposed models can surpass previous confounded models and can still make use of additional structures to improve the performance. We also design a simple structure based on Graph Convolutional Networks (GCN) in this work.

연구 동기 및 목표

  • 생성 모델 기반 제로샷 세분화 모델에서 본문에서 다룬 클래스와 볼 수 없는 클래스 사이의 심각한 성능 불균형 문제를 해결하기 위해.
  • 본문에서 다룬 클래스의 특징과 단어 임베딩 간의 잘못된 통계적 상관관계로 인해 발생하는 예측 편향을 완화하기 위해.
  • 기존 생성 모델의 핵심 아키텍처를 수정하지 않고도 일반화 성능을 향상시키는 인과 기반 훈련 전략을 개발하기 위해.
  • 성능 향상을 추가로 향상시키기 위해 GCN과 같은 보조 구조와의 호환성을 입증하기 위해.
  • 이전 모델의 구조적 개선이 성능 향상에 기여하는 이유를 이론적으로 설명하기 위해.

제안 방법

  • 실제 및 생성된 특징 분포를 조작함으로써 반사적 특징을 생성하는 반사적 추론 프레임워크를 도입한다.
  • 실제 특징과 생성된 특징의 분류를 별도의 분류기로 분리하여 독립적인 최적화를 가능하게 한다.
  • 심층 신경망이 생성된 특징과 반사적 특징을 더 정확한 분포로 재배치하기 위한 오프셋 방향을 학습한다.
  • 혼동 요인의 영향을 줄이기 위해 특징 생성 과정에서 인과 조정 전략을 적용한다.
  • ZS3Net과 같은 기존의 생성 모델과 호환되며, 그래프 컬러션 네트워크(GCNs)와 같은 보조 구조로 확장 가능하다.
  • 생성된 특징과 반사적 특징을 진정한 볼 수 없는 클래스의 특징 분포와 일치시키기 위해 글로벌 최적화 목표를 사용한다.

실험 결과

연구 질문

  • RQ1본문에서 다룬 클래스의 특징과 단어 임베딩 간의 잘못된 통계적 상관관계에서 기인하는 제로샷 세분화 모델의 편향을 어떻게 줄일 수 있는가?
  • RQ2반사적 추론은 볼 수 없는 클래스에서 생성 모델의 일반화 성능을 향상시키지만 본문에서 다룬 클래스의 성능을 떨어뜨리지 않고도 가능할까?
  • RQ3이전 모델에서의 구조적 개선(예: GCNs)이 성능 향상에 기여하는 이유는 무엇이며, 이를 인과적으로 설명할 수 있는가?
  • RQ4인과 기반 훈련 전략은 기존 모델 아키텍처와 얼마나 분리되어 있으며, 호환성이 있는가?
  • RQ5제안된 방법은 본문에서 다룬 클래스와 볼 수 없는 클래스에서 mIoU 측면에서 기존 생성 모델과 비교해 얼마나 정량적으로 우월한가?

주요 결과

  • 제안된 반사적 훈련 전략은 Pascal-VOC 및 Pascal-Context 데이터셋에서 원본 ZS3Net 모델 대비 볼 수 없는 클래스에서 mIoU를 24% 향상시키고 본문에서 다룬 클래스에서 19% 향상시켰다.
  • 이 방법은 잘못된 상관관계로 인한 분포 이탈을 수정함으로써 본문에서 다룬 클래스와 볼 수 없는 클래스의 성능 불균형을 효과적으로 줄였다.
  • GCN 기반의 구조 통합은 기존의 구조가 없는 모델 대비 전체 mIoU를 2% 향상시켰으며, 특히 Pascal-Context에서 성능 향상이 두드러졌다.
  • 접속 행렬의 시각화 결과, 모든 클래스가 동일하게 이득을 보는 것은 아니며, 성능 향상은 클래스 유사도와 이용 가능한 훈련 신호에 따라 달라진다.
  • 이 프레임워크는 이전 아키텍처 개선(예: GCNs)이 성능 향상에 기여하는 이유를 설명하는 데 성공했으며, 이는 특징 분포 학습의 인과적 구조와 더 잘 일치하기 때문이다.
  • 이 방법은 기존 생성 모델과 호환되며, 아키텍처를 대대적으로 수정하지 않고도 성능 향상을 이끌 수 있는 플러그인 훈련 전략으로 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.