Skip to main content
QUICK REVIEW

[논문 리뷰] Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic Segmentation

Fei Zhang, Tianfei Zhou|arXiv (Cornell University)|2023. 10. 29.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 비지도 개방형 어휘 세분할을 위한 새로운 프레임워크인 PGSeg를 제안하며, 비디오 트랜스포머의 그룹 토큰을 명시적으로 감독하기 위해 학습되지 않는 원형 정규화(NPR)를 도입한다. 이미지 및 텍스트 특징에 대해 가우시안 혼합 모델을 적용하여 고정된 원형 프로토타입을 생성함으로써, PGSeg는 그룹 토큰의 밀도와 풍부함을 향상시켜 학습과 추론 간의 분할 해상도 불일치 문제를 해결하고, 더 높은 정확도와 강건성을 확보한 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This paper studies the problem of weakly open-vocabulary semantic segmentation (WOVSS), which learns to segment objects of arbitrary classes using mere image-text pairs. Existing works turn to enhance the vanilla vision transformer by introducing explicit grouping recognition, i.e., employing several group tokens/centroids to cluster the image tokens and perform the group-text alignment. Nevertheless, these methods suffer from a granularity inconsistency regarding the usage of group tokens, which are aligned in the all-to-one v.s. one-to-one manners during the training and inference phases, respectively. We argue that this discrepancy arises from the lack of elaborate supervision for each group token. To bridge this granularity gap, this paper explores explicit supervision for the group tokens from the prototypical knowledge. To this end, this paper proposes the non-learnable prototypical regularization (NPR) where non-learnable prototypes are estimated from source features to serve as supervision and enable contrastive matching of the group tokens. This regularization encourages the group tokens to segment objects with less redundancy and capture more comprehensive semantic regions, leading to increased compactness and richness. Based on NPR, we propose the prototypical guidance segmentation network (PGSeg) that incorporates multi-modal regularization by leveraging prototypical sources from both images and texts at different levels, progressively enhancing the segmentation capability with diverse prototypical patterns. Experimental results show that our proposed method achieves state-of-the-art performance on several benchmark datasets. The source code is available at https://github.com/Ferenas/PGSeg.

연구 동기 및 목표

  • 모든 토큰에서 하나로의 정렬 방식으로 학습되지만, 추론 시 하나에서 하나로의 정렬 방식을 사용하는 비지도 개방형 어휘 세분할(WOVSS)에서의 분할 해상도 불일치 문제를 해결하기 위해.
  • 명시적 감독을 통해 그룹 토큰의 밀도와 풍부함을 강화하여 품질을 향상시키기 위해.
  • 외부 감독 형태로 원형 지식을 도입하여 비지도 학습과 제로샷 추론 간 격차를 메우기 위해.
  • 이미지 수준 및 텍스트 수준의 다중 모odal 원형 원천을 탐색하여 다양한 의미 패턴을 포함한 그룹 토큰 표현을 풍부하게 하기 위해.
  • 피그먼트 수준의 애너테이션에 의존하지 않고 제한된 감독 하에서도 강력한 성능을 유지하는 실용적이고 효율적인 세분할 프레임워크를 개발하기 위해.

제안 방법

  • 학습 소스 특징에 대해 가우시안 혼합 모델(GMM)을 적용하여 고정된 비학습형 원형 프로토타입을 생성함으로써, 그룹 토큰을 위한 감독을 제공하는 비학습형 원형 정규화(NPR)를 제안한다.
  • 그룹 토큰과 GMM에서 유도된 프로토타입 간의 대비 매칭을 적용하여 특징 학습을 정규화함으로써 밀도와 풍부함을 동시에 향상시킨다.
  • 이미지 수준의 NPR(I-NPR)와 텍스트 수준의 NPR(T-NPR)라는 두 가지 변형을 도입하여, 저수준의 시각적 특징과 CLIP에 의해 인코딩된 텍스트 특징을 활용해 다중 모달 감독을 제공한다.
  • 다양한 추상화 수준에서 그룹 토큰을 정교화할 수 있도록, I-NPR과 T-NPR을 통합하는 점진적 학습 전략을 설계한다.
  • 학습 가능한 그룹 토큰을 갖춘 비전 트랜스포머 백본을 사용하며, 정규화는 특징 클러스터링 과정에 적용되어 세분할 정밀도를 향상시킨다.
  • 그룹 토큰과 프로토타입 간의 대비 손실을 사용하여, 각 그룹 토큰이 일관되고 노이즈가 줄어든, 의미적으로 풍부한 영역을 표현하도록 보장한다.

실험 결과

연구 질문

  • RQ1비지도 개방형 어휘 세분할에서 그룹 토큰에 명시적 감독을 제공하는 방법은 무엇인가? 이는 학습과 추론 간의 분할 해상도 불일치 문제를 해결하는 데 기여할 수 있는가?
  • RQ2어떤 종류의 원형 지식이 그룹 토큰의 특징 표현에서 밀도와 풍부함을 동시에 달성하는 데 효과적으로 기여할 수 있는가?
  • RQ3이미지와 텍스트 양측에서 유도된 다중 모달 프로토타입은 제로샷 세분할에서 그룹 토큰의 일반화 능력과 강건성을 향상시키는 데 기여하는가?
  • RQ4비학습형 원형 정규화가 비지도 학습 환경에서 엔드 투 엔드로 학습된 클러스터링에 비해 얼마나 뛰어난 성능을 보이는가?
  • RQ5이미지 수준과 텍스트 수준의 프로토타입 통합은 전체 세분할 성능과 특징 다양성에 어떤 영향을 미치는가?

주요 결과

  • PGSeg는 다양한 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, 기존의 WOVSS 방법에 비해 뛰어난 세분할 정확도를 보였다.
  • 제안된 NPR는 그룹 토큰의 밀도를 크게 향상시켜 특징 공간 내의 중복성과 노이즈를 감소시켰으며, 시각화 및 특징 분산 분석을 통해 검증되었다.
  • PGSeg에서 그룹 토큰 특징의 차원 분산은 GroupViT보다 상당히 높아, 더 나은 표현 다양성과 차원 붕괴 감소를 나타낸다.
  • 계산 비용은 합리적인 수준을 유지하였으며, 13.6G FLOPs와 35.1M 파라미터를 기록하여 ViT-S보다 낮고, GroupViT보다 오직 3.2G 더 높을 뿐이므로 뛰어난 효율성을 확보하였다.
  • 시각적 비교 결과, PGSeg는 제한된 훈련 데이터에도 불구하고 클래스에 종속되지 않은 방식으로 전체 물체를 효과적으로 포착하며, 우산이나 배와 같은 직관적인 카테고리에서도 경쟁력 있는 성능을 달성하였다.
  • 제거 분석 결과, I-NPR과 T-NPR 모두 긍정적인 기여를 하였으며, 조합 시 최고의 성능을 기록하여 다중 모달 원형 감독의 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.