Skip to main content
QUICK REVIEW

[논문 리뷰] ACSeg: Adaptive Conceptualization for Unsupervised Semantic Segmentation

Kehan Li, Zhennan Wang|arXiv (Cornell University)|2022. 10. 12.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

ACSeg는 자기지도 ViT 특징에서 얻은 픽셀 수준의 표현을 동적으로 군집화하기 위해 학습 가능한 프로토타입과 적응형 개념 생성기(ACG)를 사용하는 비지도 의미 분할을 위한 적응형 개념화 프레임워크를 제안한다. 모odu larit의 손실을 최적화하여 적응형 개념 수 계산이 가능하게 함으로써, 주석 없이도 PASCAL VOC 2012 및 COCO-Stuff에서 최고 성능을 달성하며, 군집화 및 제로샷 분류 설정 모두에서 이전 방법들을 능가한다.

ABSTRACT

Recently, self-supervised large-scale visual pre-training models have shown great promise in representing pixel-level semantic relationships, significantly promoting the development of unsupervised dense prediction tasks, e.g., unsupervised semantic segmentation (USS). The extracted relationship among pixel-level representations typically contains rich class-aware information that semantically identical pixel embeddings in the representation space gather together to form sophisticated concepts. However, leveraging the learned models to ascertain semantically consistent pixel groups or regions in the image is non-trivial since over/ under-clustering overwhelms the conceptualization procedure under various semantic distributions of different images. In this work, we investigate the pixel-level semantic aggregation in self-supervised ViT pre-trained models as image Segmentation and propose the Adaptive Conceptualization approach for USS, termed ACSeg. Concretely, we explicitly encode concepts into learnable prototypes and design the Adaptive Concept Generator (ACG), which adaptively maps these prototypes to informative concepts for each image. Meanwhile, considering the scene complexity of different images, we propose the modularity loss to optimize ACG independent of the concept number based on estimating the intensity of pixel pairs belonging to the same concept. Finally, we turn the USS task into classifying the discovered concepts in an unsupervised manner. Extensive experiments with state-of-the-art results demonstrate the effectiveness of the proposed ACSeg.

연구 동기 및 목표

  • 이미지 간 시나리오 복잡도와 의미 분포의 다양성으로 인한 비지도 의미 분할에서의 일관성 없는 군집화 문제를 해결하기 위해.
  • 고정된 군집 수나 주석 없이 픽셀 수준의 표현에서 의미적으로 일관된 개념(영역)을 적응적으로 발견할 수 있도록 하기 위해.
  • 시각-언어 모델을 사용한 분류에 적합한 고품질의 국소화된 영역 수준 표현을 생성하여 제로샷 의미 분할 성능을 향상시키기 위해.
  • 각 이미지당 다양한 개념 수를 지원하면서도 강건성과 효율성을 유지할 수 있도록 훈련 목표를 설계하기 위해.

제안 방법

  • 학습 가능한 프로토타입을 도입하여 표현 공간에 의미 개념을 명시적으로 인코딩한다.
  • 픽셀 수준의 특징과 프로토타입 간의 스케일드 닷프로덕트 어텐션을 사용하여 각 이미지별로 프로토타입을 동적으로 업데이트하는 적응형 개념 생성기(ACG)를 제안한다.
  • ACG는 개념 수에 관계없이 유사도가 높은 픽셀 쌍이 같은 개념에 속하도록 유도하는 새로운 모듈성 손실을 통해 엔드 투 엔드로 훈련된다.
  • 모듈성 손실은 픽셀 표현 간 유사도를 대체로 나타내는 유사도 그래프에서 계산되며, 픽셀 간 연결 강도를 의미적 유사도의 지표로 모델링한다.
  • 개념 발견 후, 분할 작업은 k-NN 분류기 또는 CLIP와 같은 시각-언어 모델을 사용하여 이러한 개념을 분류하는 것으로 설정된다.
  • 이 프레임워크는 완전히 비지도이며, 분할 전용 주석에 대한 미세조정 없이도 이식 가능하다.

실험 결과

연구 질문

  • RQ1각 이미지의 의미 분포에 맞게 개념 발견을 적응적으로 조정함으로써 비지도 의미 분할 성능를 어떻게 향상시킬 수 있는가?
  • RQ2학습 가능한 프로토타입 기반의 동적 적응 방식이 고정 군집 또는 배경/전경 분할 방법보다 우월한가?
  • RQ3모듈성 기반의 손실이 감독 없이도 적응형 개념 수 계산을 얼마나 잘 지원하는가?
  • RQ4발견된 개념들이 사전 훈련된 시각-언어 모델을 사용한 제로샷 분류에 얼마나 잘 일반화되는가?

주요 결과

  • ACSeg는 주석 없이도 PASCAL VOC 2012 비지도 의미 분할 벤치마크에서 최고 성능을 달성하며, 후처리나 미세조정 없이도 이전 방법들을 능가한다.
  • k-NN 검색 정확도 측정 기준으로, VOC 데이터셋에서 k-means, 스펙트럴 군집, 어파티티 프로파게이션보다 뛰어난 영역 수준 표현 품질을 확보한다.
  • 16개의 프로토타입을 사용할 때, ACSeG는 PASCAL VOC 2012에서 평균 교차율(mIoU) 52.1%를 달성하여 다양한 프로토타입 수에 걸쳐 강건성과 확장성을 입증한다.
  • 이미지 특화된 의미적 구조를 적응적으로 모델링할 수 있는 능력 덕분에, ACG 기반 접근법이 고전적 군집 알고리즘보다 뛰어난 성능을 내며.
  • CLIP와 조합했을 때, MaskCLIP, GroupViT, ReCo보다 더 높은 제로샷 분류 정확도를 확보하여 개념의 국소화 품질이 뛰어나다는 것을 입증한다.
  • 절단 실험 결과, 모듈성 손실이 적응형 개념 발견을 가능하게 함을 확인: 너무 적은 프로토타입(예: 2개)은 과소 군집을 유도하고, 너무 많은 경우 과잉 군집이 발생하며, 중간 범위에서 최적의 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.