Skip to main content
QUICK REVIEW

[논문 리뷰] CANet: Class-Agnostic Segmentation Networks with Iterative Refinement and Attentive Few-Shot Learning

Chi Zhang, Guosheng Lin|arXiv (Cornell University)|2019. 03. 06.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 45
한 줄 요약

CANet은 두 가지 분기 Dense Comparison 모듈과 반복적 개선 모듈, 그리고 다중 지원에서의 주의 기반 k-샷 융합 메커니즘을 갖춘 클래스 비특정 few-shot 분할 프레임워크를 제안하고, 1샷 및 5샷 설정에서 PASCAL VOC 2012의 평균 IoU에서 최첨단을 달성하며 경계 상자 보 supervision에 대해 강인함을 보인다.

ABSTRACT

Recent progress in semantic segmentation is driven by deep Convolutional Neural Networks and large-scale labeled image datasets. However, data labeling for pixel-wise segmentation is tedious and costly. Moreover, a trained model can only make predictions within a set of pre-defined classes. In this paper, we present CANet, a class-agnostic segmentation network that performs few-shot segmentation on new classes with only a few annotated images available. Our network consists of a two-branch dense comparison module which performs multi-level feature comparison between the support image and the query image, and an iterative optimization module which iteratively refines the predicted results. Furthermore, we introduce an attention mechanism to effectively fuse information from multiple support examples under the setting of k-shot learning. Experiments on PASCAL VOC 2012 show that our method achieves a mean Intersection-over-Union score of 55.4% for 1-shot segmentation and 57.1% for 5-shot segmentation, outperforming state-of-the-art methods by a large margin of 14.6% and 13.2%, respectively.

연구 동기 및 목표

  • 미리 주석이 있는 소수 예제(few-shot learning)로도 보지 못한 클래스의 분할을 클래스 비특정 설정에서 가능하게 한다.
  • 지원 이미지와 질의 이미지 간의 픽셀 단위의 Dense 비교를 수행하기 위해 다중 수준 CNN 특징을 활용한다.
  • 클래스 내 appearance 변화를 다루기 위해 분할 결과를 반복적으로 개선한다.
  • k-shot 시나리오에서 다중 지원 예제의 정보를 효과적으로 융합하기 위한 주의 메커니즘을 도입한다.
  • 지원 데이터에 대한 바운딩 박스 기반의 약 지도 학습으로 라벨링 부담을 줄인다.

제안 방법

  • 두 가지 분기 Dense Comparison 모듈(DCM)은 중간 수준의 CNN 특징(block2 및 dilations가 적용된 ResNet-50의 block3)을 사용하여 지원 이미지와 질의 이미지 간의 글로벌 전경 가이드.Dense 비교를 수행한다.
  • 전경 영역에 대한 글로벌 평균 풀링을 통해 전역 특징 벡터를 얻고, 이를 질의 특징 맵의 모든 위치와 연결하여 비교하고, 3x3 합성곱 블록을 사용해 업샘플링하고 융합한다.
  • 추정 마스크를 후속 반복으로 피드백하여 잔차 연결을 통해 예측을 개선하는 반복 최적화 모듈(IOM); 다중 스케일 특징을 위한 ASPP를 도입한다.
  • 학습 시에는 엔드-투-엔드 학습과 교차 엔트로피 손실을 포함하고, IOM의 과적합을 줄이기 위한 예측 마스크의 확률적 드롭(p_r)을 사용하며, 마스크 없이 초기 순방향 패스와 마스크의 점진적 사용을 선택적으로 수행한다.
  • k-shot 분할을 위한 주의 메커니즘은 k개의 지원 예제에 걸친 가중치를 학습하고 소프트맥스 정규화 주의 점수로 Dense 비교 특징을 융합한다.

실험 결과

연구 질문

  • RQ1클래스 비특정 분할 모델이 소수의 라벨링된 예제만으로 보지 못한 클래스에 일반화할 수 있는가?
  • RQ2중간 수준의 CNN 특징을 사용한 Dense 비교 접근법이 이전 방법들과 비교해 few-shot 분할을 개선하는가?
  • RQ3특히 복잡한 객체 형태에 대해 few-shot 작업의 분할 품질을 향상시키기 위해 반복적 개선이 도움이 되는가?
  • RQ4k-shot 설정에서 다중 지원 예제의 학습 가능한 융합이 비학습적 융합 방법보다 더 효과적인가?
  • RQ5지원 세트의 바운딩 박스 보 supervision은 분할 성능의 큰 손실 없이 현실적으로 가능한가?

주요 결과

  • CANet은 PASCAL VOC 2012에서 1샷 평균 IoU 55.4%, 5샷 평균 IoU 57.1%를 달성하여 이전 방법보다 각각 14.6% 및 13.2%의 meanIoU 향상을 보였다.
  • 반복 최적화 모듈(IOM)은 PASCAL-5i에서 초기 CANet 예측 대비 2.8%의 개선을 제공한다.
  • k-shot에서의 주의 기반 융합은 특징 평균화, 마스크 평균화, 로직-OR 융합에 비해 meanIoU에서 현저히 우수한 성능을 보인다.
  • 바운딩 박스 주석의 지원 세트는 픽셀 수준 주석과 유사한 성능을 보이며(표 2 맥락에서 54.0% 대 52.0% meanIoU), 지도 효율성 측면에서 높은 라벨링 효율을 시사한다.
  • COCO에서 1샷 결과는 IOM에 의해 평균IoU가 4.1% 증가하고 다중 스케일 평가가 추가 이득을 제공하며, 5샷에서는 주의 기반 융합이 비학습 기반 베이스라인 중 최적의 결과를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.