Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Segmentation with Optimal Transport Matching and Message Flow

Weide Liu, Chi Zhang|arXiv (Cornell University)|2021. 08. 19.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 쿼리 및 서포트 특징 간에 조밀하고 제약 있는 대응 관계를 수립하기 위해 부분 최적 운반 매칭을 사용하는 few-shot 세그멘테이션 모델인 CMNet을 제안한다. 또한 메시지 플로우 모듈을 도입하여 국소적이고 전역적인 특징 표현을 향상시킨다. 이 방법은 표준 및 약한 지도 학습 설정 하에서 PASCAL VOC 2012, MS COCO, FSS-1000에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

We tackle the challenging task of few-shot segmentation in this work. It is essential for few-shot semantic segmentation to fully utilize the support information. Previous methods typically adopt masked average pooling over the support feature to extract the support clues as a global vector, usually dominated by the salient part and lost certain essential clues. In this work, we argue that every support pixel's information is desired to be transferred to all query pixels and propose a Correspondence Matching Network (CMNet) with an Optimal Transport Matching module to mine out the correspondence between the query and support images. Besides, it is critical to fully utilize both local and global information from the annotated support images. To this end, we propose a Message Flow module to propagate the message along the inner-flow inside the same image and cross-flow between support and query images, which greatly helps enhance the local feature representations. Experiments on PASCAL VOC 2012, MS COCO, and FSS-1000 datasets show that our network achieves new state-of-the-art few-shot segmentation performance.

연구 동기 및 목표

  • 이전 few-shot 세그멘테이션 방법이 서포트 특징의 전역 평균 풀링에 의존함으로써 공간적 구조를 손실하고, 덜 구분 가능한 부분을 효율적으로 활용하지 못하는 한계를 해결한다.
  • 이전 방법에서 발생하는 다대일 매칭 문제를 해결하기 위해 쿼리 및 서포트 특징 간에 제약 있는 다대다 대응 관계를 가능하게 한다.
  • 내부 흐름(이미내)과 이미지 간 흐름(크로스 흐름)을 통해 메시지를 전파하는 메시지 플로우 모듈을 도입하여 국소적 특징 표현을 향상시킨다.
  • 경계 상자 애너테이션과 같은 약한 지도 학습 설정 하에서도 성능을 향상시키기 위해 제한된 애너테이션 유형에서도 높은 정확도를 유지한다.
  • 의심스럽거나 유사한 외관을 가진 객체에 대해 강건성을 확보하기 위해 실패 케이스를 검증하고 모델의 한계를 분석한다.

제안 방법

  • 지표에서 제공된 객체 크기에 기반한 최대 매칭 흐름을 강제하는 부분 최적 운반(POT) 매칭 모듈을 제안하여 쿼리 및 서포트 특징 간에 더 균형 잡히고 포괄적인 대응 관계를 확보한다.
  • 쿼리 및 서포트 특징을 그래프로 모델링하여 내부 흐름(이미내)과 크로스 흐름(이미지 간) 메커니즘을 통해 메시지를 전파하는 메시지 플로우 모듈을 도입한다.
  • 공간적 정렬과 대응 정확도 향상을 위해 특징 표현에 위치 인코딩을 통합한다.
  • 크로스 어텐션과 특징 정제를 통해 매칭 및 전파된 특징을 기반으로 세그멘테이션 예측을 안내하는 이중 브랜치 인코더-디코더 아키텍처를 통합한다.
  • 기존 마스크를 적용한 후 POT 모듈을 적용하여 전체 최적 운반에서 유도된 노이즈가 많거나 잘못된 대응 관계에 과적합되는 것을 방지한다.
  • 픽셀 수준의 서포트 애너테이션을 경계 상자로 대체하여 약한 지도 학습 설정 하에서 방법을 검증함으로써 더러운 지도 학습에 대한 강건성을 입증한다.

실험 결과

연구 질문

  • RQ1부분 최적 운반과 같은 제약 있는 다대다 매칭 메커니즘이 전역 풀링이나 비제약 매칭에 비해 few-shot 세그멘테이션에서 대응 학습을 향상시키는가?
  • RQ2국소적 및 전역 특징 공간 간의 메시지 전파가 덜 구분 가능한 객체 부분에 대해 세그멘테이션 정확도를 어떻게 향상시키는가?
  • RQ3위치 인코딩을 통합함으로써 few-shot 환경에서 공간적 정렬과 세그멘테이션 성능이 향상되는가?
  • RQ4픽셀 수준 마스크가 아닌 경계 상자로만 서포트 애너테이션이 제공될 경우, 제안된 방법이 높은 성능을 유지할 수 있는가?
  • RQ5모델의 실패 모드는 무엇이며, 이는 쿼리 이미지에서 시각적 유사성 또는 의미적 맥락의 부족과 어떻게 관련이 있는가?

주요 결과

  • CMNet는 1-shot 설정에서 62.5% mIoU를 기록하여 PASCAL VOC 2012에서 최신 기술 수준 성능을 달성하였으며, 이는 이전 방법인 PGNet(61.7% mIoU)을 초월한다.
  • MS COCO 데이터셋에서, 1-shot 및 5-shot 설정 모두에서 이전 최신 기술 수준 방법들 중에서 가장 높은 성능을 기록한다.
  • FSS-1000 벤치마크에서, CMNet는 1-shot 및 5-shot 평가 프로토콜 모두에서 새로운 최신 기술 수준 결과를 수립한다.
  • 제거 실험을 통해 위치 인코딩이 성능을 0.4 mIoU 향상시켜, PASCAL VOC 2012의 1-shot 평가에서 62.1%에서 62.5%로 증가시킴을 확인한다.
  • 전체 최적 운반 매칭을 사용할 경우 부분 최적 운반에 비해 성능이 저하됨을 확인하여, 제약 있는 매칭이 배경 영역과 같은 잘못된 대응 관계를 방지함을 시사한다.
  • 경계 상자 기반 서포트 애너테이션을 사용하는 약한 지도 학습 설정 하에서, CMNet는 PASCAL VOC 2012 및 FSS-1000에서 기존 방법들을 모두 압도하며, 감소된 지도 학습 하에서도 강력한 일반화 성능을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.