Skip to main content
QUICK REVIEW

[논문 리뷰] Regional Semantic Contrast and Aggregation for Weakly Supervised Semantic Segmentation

Tianfei Zhou, Meijie Zhang|arXiv (Cornell University)|2022. 03. 17.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

이 논문은 이미지 레벨 레이블만을 사용하여 약한 감독(semi) 분할을 위한 새로운 방법인 지역적 의미 대비 및 집합(RCA)을 제안한다. RCA는 지속적으로 업데이트되는 가상 영역 메모리 백을 활용하여 데이터셋 수준의 의미 대비 및 집합을 실현하며, 객체 국소화 및 표현 학습을 크게 향상시킨다. 이로 인해 PASCAL VOC 2012에서 73.2%의 새로운 최고 성능(mIoU)을 달성하였고, COCO 2014에서는 72.8%를 기록하였다.

ABSTRACT

Learning semantic segmentation from weakly-labeled (e.g., image tags only) data is challenging since it is hard to infer dense object regions from sparse semantic tags. Despite being broadly studied, most current efforts directly learn from limited semantic annotations carried by individual image or image pairs, and struggle to obtain integral localization maps. Our work alleviates this from a novel perspective, by exploring rich semantic contexts synergistically among abundant weakly-labeled training data for network learning and inference. In particular, we propose regional semantic contrast and aggregation (RCA) . RCA is equipped with a regional memory bank to store massive, diverse object patterns appearing in training data, which acts as strong support for exploration of dataset-level semantic structure. Particularly, we propose i) semantic contrast to drive network learning by contrasting massive categorical object regions, leading to a more holistic object pattern understanding, and ii) semantic aggregation to gather diverse relational contexts in the memory to enrich semantic representations. In this manner, RCA earns a strong capability of fine-grained semantic understanding, and eventually establishes new state-of-the-art results on two popular benchmarks, i.e., PASCAL VOC 2012 and COCO 2014.

연구 동기 및 목표

  • 약한 감독 분할에서 희소한 이미지 레벨 레이블로부터 조밀한 객체 국소화를 학습하는 데 도전하는 것.
  • 단일 이미지 또는 쌍별 맥락 모델링의 한계를 극복하기 위해 전체 훈련 데이터셋을 통틀어 통합된 의미적 구조를 활용하는 것.
  • 거대한 약한 레이블링 데이터로부터 풍부하고 다양한 맥락 지식을 활용하여 특징 표현 학습 및 CAM 기반 국소화를 향상시키는 것.
  • 효과적이고 확장 가능하며 강건한 의미 대비 및 집합을 가능하게 하는 메모리 보강 프레임워크를 개발하는 것.

제안 방법

  • RCA는 모든 훈련 이미지에서 유도된 가상 영역 특징을 저장하고 지속적으로 업데이트하는 지역적 메모리 백을 도입하여 데이터셋 전반에 걸친 다양한 객체 패턴을 포괄한다.
  • 메모리 백에 포함된 동일한 카테고리의 임bedding을 가까이 모으고, 다른 카테고리의 임bedding을 밀어내는 의미 대비를 수행함으로써, 분류 가능한 표현 학습을 향상시킨다.
  • 비모수적 어텐션 메커니즘을 통해 각 이미지에 대해 관련 있는 메모리 특징을 요약함으로써 의미 집합을 달성하며, 지역 표현에 전역 맥락 지식을 통합한다.
  • 모델은 굵은 CAM 예측을 사용해 각 이미지의 카테고리별 가상 영역을 생성하고, 이를 훈련 중 대비 및 집합 신호 계산에 활용한다.
  • 표준 분류 백본과 호환되며, 기존의 약한 감독 분할 파ip라인에 원활하게 통합될 수 있다.
  • 최종 분할 맵은 메모리 백에서 유도된 집합적 맥락 인식 특징을 사용해 CAM을 정밀하게 보정함으로써 국소화 정확도를 향상시킨다.
Figure 1 : The main idea promoted throughout the paper is that semantic contexts subserve localization of individual objects in WSSS. Our RCA thus performs dataset-level relation learning (c) to mine rich contextual knowledge from massive (ideally all) training samples, rather than from an individua
Figure 1 : The main idea promoted throughout the paper is that semantic contexts subserve localization of individual objects in WSSS. Our RCA thus performs dataset-level relation learning (c) to mine rich contextual knowledge from massive (ideally all) training samples, rather than from an individua

실험 결과

연구 질문

  • RQ1거대한 약한 레이블링 데이터에서 유도된 데이터셋 수준의 의미 맥락은 약한 감독 분할에서 객체 국소화를 크게 향상시킬 수 있는가?
  • RQ2밀도 높은 감독 없이도 가상 영역 메모리 백을 효과적으로 활용해 이미지 간 의미 관계를 모델링할 수 있는가?
  • RQ3데이터셋 전반에 걸친 영역 간 의미 대비가 특징의 분류 능력과 표현 품질을 어느 정도 향상시키는가?
  • RQ4전역 메모리 백에서 유도된 의미 집합이 복잡한 환경에서 CAM 기반 국소화의 강건성과 정확도를 향상시킬 수 있는가?
  • RQ5제안된 RCA 프레임워크는 이미지 레벨 감독만을 사용하여 PASCAL VOC 2012 및 COCO 2014와 같은 표준 벤치마크에서 최고 성능을 달성하는가?

주요 결과

  • OAA++ 베이스라인과 결합했을 때 RCA는 PASCAL VOC 2012 검증 세트에서 73.2%의 새로운 최고 성능(mIoU)을 기록하였으며, 이는 베이스라인 대비 3.8% 향상된 결과이다.
  • COCO 2014 검증 세트에서는 mIoU가 72.8%를 기록하였으며, EPS 베이스라인 대비 2.0% 향상되었고, 이전 최고 성능 방법 대비 1.3% 향상되었다.
  • 정성적 결과를 통해 소형 객체, 척도 변화, 가림, 다중 인스턴스 등 도전적인 케이스에서 뛰어난 일반화 성능을 보였다.
  • 제거 분석 결과, 의미 대비 및 집합 구성 요소가 성능 향상에 기여하며, 특히 장거리 맥락 의존성을 포착하는 데 메모리 백이 핵심적인 역할을 한다는 것이 확인되었다.
  • ResNet 및 VGG와 같은 다양한 백본과 데이터셋에서 RCA 프레임워크는 기존 방법을 일관되게 초월하여 강건성과 확장성을 입증하였다.
  • RCA가 생성한 최종 분할 맵은 중간 단계의 CAM 예측보다 훨씬 정확하고 완전한 결과를 보였으며, 이는 집합 및 보정 메커니즘의 효과성을 검증한다.
Figure 2 : Detailed illustration of regional semantic contrast and aggregation . See § 3 for more details.
Figure 2 : Detailed illustration of regional semantic contrast and aggregation . See § 3 for more details.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.