Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer-CNN Cohort: Semi-supervised Semantic Segmentation by the Best of Both Students

Zheng Xu, Yunhao Luo|arXiv (Cornell University)|2022. 09. 06.
Advanced Neural Network Applications인용 수 8
한 줄 요약

이 논문은 시각 트랜스포머(ViT)와 컨volution 신경망(CNN)을 이중 학생으로 활용하는 새로운 준지도 학습 세분화 프레임워크인 Transformer-CNN Cohort(TCC)를 제안한다. 클래스 인식 특징 일관성 정규화(CFCD)와 일관성 인식 교차 정규화(CCD)를 도입하여, 가짜 레이블링을 통해 특징 공간과 예측 공간에서 다중 수준의 일관성을 강제함으로써, Cityscapes와 Pascal VOC 2012에서 최신 기준 성능을 달성하며 기존 방법에 비해 뚜렷한 정확도 향상을 이룬다.

ABSTRACT

The popular methods for semi-supervised semantic segmentation mostly adopt a unitary network model using convolutional neural networks (CNNs) and enforce consistency of the model's predictions over perturbations applied to the inputs or model. However, such a learning paradigm suffers from two critical limitations: a) learning the discriminative features for the unlabeled data; b) learning both global and local information from the whole image. In this paper, we propose a novel Semi-supervised Learning (SSL) approach, called Transformer-CNN Cohort (TCC), that consists of two students with one based on the vision transformer (ViT) and the other based on the CNN. Our method subtly incorporates the multi-level consistency regularization on the predictions and the heterogeneous feature spaces via pseudo-labeling for the unlabeled data. First, as the inputs of the ViT student are image patches, the feature maps extracted encode crucial class-wise statistics. To this end, we propose class-aware feature consistency distillation (CFCD) that first leverages the outputs of each student as the pseudo labels and generates class-aware feature (CF) maps for knowledge transfer between the two students. Second, as the ViT student has more uniform representations for all layers, we propose consistency-aware cross distillation (CCD) to transfer knowledge between the pixel-wise predictions from the cohort. We validate the TCC framework on Cityscapes and Pascal VOC 2012 datasets, which outperforms existing SSL methods by a large margin.

연구 동기 및 목표

  • 기존 준지도 학습(SSL) 방법의 세분화에서 전역적이고 국소적인 특징을 효과적으로 학습하지 못하고, 이질적인 모델 간의 상보적 지식을 활용하지 못하는 한계를 해결하기 위해.
  • 일반적으로 일관성 정규화에 의존하는 단일 아키텍처 SSL 모델이 특징과 예측의 중복을 초래하는 제약을 극복하기 위해.
  • 시각 트랜스포머(ViT)와 CNN이 이질적인 특징 공간과 예측 헤드 간의 지식을 교환함으로써 준지도 세분화 성능을 향상시킬 수 있는 방법을 탐색하기 위해.
  • 가짜 레이블링을 예측 수준뿐 아니라 특징 수준에서도 효과적으로 적용하기 위해, 클래스 인식 특징 맵을 활용하여 특징 수준의 일관성 향상을 도모하기 위해.
  • 이미지넷 사전 훈련 없이도, 이질적인 모델 코hort(ViT + CNN)가 동일한 아키텍처의 대안보다 우수한 성능을 내는지 입증하기 위해.

제안 방법

  • TCC 프레임워크는 두 가지 다른 학생 모델을 사용한다: 하나는 시각 트랜스포머(ViT) 기반, 다른 하나는 컨volution 신경망(CNN) 기반으로, 이질적인 코hort를 형성한다.
  • 클래스 인식 특징 일관성 정규화(CFCD)는 가짜 레이블 예측에서 유도된 클래스 인식 특징(CF) 맵을 활용하여 두 학생 간의 지식을 전달함으로써 특징 수준의 일관성 정규화를 실현한다.
  • 일관성 인식 교차 정규화(CCD)는 ViT와 CNN 학생 간의 픽셀 수준 예측 일관성을 강제하기 위해 코호트 간의 예측을 정규화함으로써 예측 수준의 강건성을 향상시킨다.
  • 가짜 레이블링은 비정규화된 데이터에 적용되어 예측 및 특징 수준의 지도 신호를 생성하며, 동일한 가짜 레이블을 공유하는 픽셀의 특징 평균을 통해 CF 맵을 계산한다.
  • 다중 수준 일관성 정규화를 적용한다: CFCD는 중간 특징 맵에서 작동하고, CCD는 최종 세분화 예측에서 작동하여 상호 보완적인 지식 전달을 보장한다.
  • 이 방법은 이미지넷 사전 훈련 없이도, 정규화된 데이터에 대한 감독 손실과 비정규화된 데이터에 대한 일관성 손실(CFCD 및 CCD)을 조합하여 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1ViT와 CNN을 조합한 이질적 이중 학생 프레임워크가 단일 아키텍처 모델을 초월해 준지도 세분화 성능을 향상시킬 수 있는가?
  • RQ2MSA와 컨볼루션의 근본적인 아키텍처 차이를 고려할 때, SSL 맥락에서 서로 다른 아키텍처의 모델 간에 지식을 효과적으로 전달할 수 있는가?
  • RQ3클래스 인식 특징 맵을 통한 특징 수준의 가짜 레이블링은 예측 수준의 가짜 레이블링에 비해 모델 일반화 및 특징 분류 능력을 향상시키는가?
  • RQ4이질적인 특징 공간과 예측 헤드 간에 일관성 정규화를 효과적으로 적용할 수 있는가? 이는 강건성 및 성능 향상에 기여하는가?
  • RQ5이중 학생 프레임워크는 이미지넷 사전 훈련 없이도, 사전 훈련된 모델에 의존하는 최신 기준 방법보다 뛰어난 성능을 내는가?

주요 결과

  • TCC는 Cityscapes와 Pascal VOC 2012에서 모두 최신 기준 성능을 달성하며, 이전의 SSL 방법들—특히 이전의 SoTA 방법인 CPS—를 크게 앞서 간다.
  • Pascal VOC 2012에서 1/8 레이블 비율로 훈련할 경우, TCC-S는 mIoU 82.32%를 기록하여, 라벨 데이터만을 사용한 완전한 감독 훈련에 비해 5.49% 향상된 성능을 보였다.
  • 이미지넷 사전 훈련 없이도, 사전 훈련된 모델에 의존하는 이전 SoTA 방법을 초월하여, 비정규화된 데이터에서 강력한 일반화 능력을 입증하였다.
  • 제거 실험 결과, CFCD 및 CCD 손실 모두 모든 레이블 비율에서 mIoU 향상에 기여함을 확인하였으며, 비정규화된 데이터가 감소함에 따라 CFCD의 기여도는 점차 감소하는 경향을 보였다.
  • TSNE 시각화 결과, CFCD는 클래스 간 특징 분離도를 향상시켜, 특징의 분류 능력을 높이고 내부 클래스 분산을 감소시킴을 확인하였다.
  • 추론 과정에서 ViT 기반 학생이 항상 CNN 기반 학생보다 뛰어난 성능을 보였으며, 이는 MSA 기반 표현이 코호트 내에서 뛰어난 특징 학습 능력을 지닌다는 것을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.