Skip to main content
QUICK REVIEW

[논문 리뷰] Conflict-Based Cross-View Consistency for Semi-Supervised Semantic Segmentation

Zicheng Wang, Zhen Zhao|arXiv (Cornell University)|2023. 03. 02.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 두 가지 분기 구조를 갖는 프레임워크를 통해 공훈련을 향상시키는 새로운 반감독 세분화 방법인 충돌 기반 교차뷰 일관성(CCVC)을 제안한다. 특징 불일치 손실을 활용한 교차뷰 일관성(CVC)을 도입하여 하위 네트워크 붕괴를 방지하고, 충돌 예측을 활용해 훈련을 안정화시키는 충돌 기반 가짜 라벨링(CPL)을 제안하여, 1/4 라벨 분할 조건에서 Pascal VOC 2012에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Semi-supervised semantic segmentation (SSS) has recently gained increasing research interest as it can reduce the requirement for large-scale fully-annotated training data. The current methods often suffer from the confirmation bias from the pseudo-labelling process, which can be alleviated by the co-training framework. The current co-training-based SSS methods rely on hand-crafted perturbations to prevent the different sub-nets from collapsing into each other, but these artificial perturbations cannot lead to the optimal solution. In this work, we propose a new conflict-based cross-view consistency (CCVC) method based on a two-branch co-training framework which aims at enforcing the two sub-nets to learn informative features from irrelevant views. In particular, we first propose a new cross-view consistency (CVC) strategy that encourages the two sub-nets to learn distinct features from the same input by introducing a feature discrepancy loss, while these distinct features are expected to generate consistent prediction scores of the input. The CVC strategy helps to prevent the two sub-nets from stepping into the collapse. In addition, we further propose a conflict-based pseudo-labelling (CPL) method to guarantee the model will learn more useful information from conflicting predictions, which will lead to a stable training process. We validate our new CCVC approach on the SSS benchmark datasets where our method achieves new state-of-the-art performance. Our code is available at https://github.com/xiaoyao3302/CCVC.

연구 동기 및 목표

  • 가짜 라벨링과 공훈련 프레임워크에서의 모델 붕괴로 인한 확인 편향을 해결하기 위해.
  • 동일한 입력에 대해 서로 다른 비중복 시각에서 하위 네트워크가 학습하도록 강제하여 모델 일반화 능력을 향상시키기 위해.
  • 충돌 예측을 활용한 충돌 기반 가짜 라벨링 전략을 통해 훈련을 안정화시키기 위해.
  • 특징 다양성을 보장하지 못할 수 있는 수작업 데이터 증강에 대한 의존도를 줄이기 위해.
  • 최소한의 완전 레이블 데이터로 최신 기술 성능을 달성하기 위해.

제안 방법

  • 두 하위 네트워크가 추출한 특징 간 유사도를 최소화하기 위해 특징 불일치 손실을 활용한 교차뷰 일관성(CVC)을 도입하여, 관련 없는 시각에서 학습을 유도한다.
  • 서로 다른 하위 네트워크 간 지식 전이를 위해 교차 가짜 라벨링을 활용하여 예측 일관성과 모델 인식 능력을 향상시킨다.
  • 높은 불일치를 보이는 하위 네트워크의 예측을 활용해 더 강력한 감독 신호를 제공하는 충돌 기반 가짜 라벨링(CPL)을 제안하여 훈련 안정성을 향상시킨다.
  • 충돌 예측에서의 자기지도 학습을 균형 잡기 위해 가중 일관성 손실($\omega_c$)을 사용하여 편향된 가짜 라벨에 과적합되는 것을 방지한다.
  • Pascal VOC 2012에서 ResNet-101을 백본으로 사용하는 DeepLabv3+를 활용한 두 분기 공훈련 프레임워크 내에서 방법을 적용한다.
  • 일관성과 강건성 간의 트레이드오���을 최적화하기 위해 초모수 분석을 수행하며, 총 40 에포크 동안 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1하위 네트워크 간 특징 불일치를 강제하면 공훈련 기반 반감독 세분화에서 붕괴를 방지할 수 있는가?
  • RQ2전용 가짜 라벨링 전략을 통해 충돌 예측을 활용하면 훈련 안정성과 성능이 향상되는가?
  • RQ3기본 일관성 정규화 또는 CCR 방법과 비교해 충돌 기반 접근법이 확인 편향을 줄일 수 있는가?
  • RQ4일관성 손실의 가중치가 충돌 예측에서의 일반화 능력에 어떤 영향을 미치는가?
  • RQ51/4 라벨 분할과 같은 저감독 설정에서 제안된 방법이 mIoU에 얼마나 기여하는가?

주요 결과

  • 제안된 CCVC 방법은 1/4 라벨 분할 조건에서 Pascal VOC 2012 데이터셋에서 평균 교차율(mIoU) 74.0%를 달성하여 새로운 최신 기술 수준을 수립한다.
  • CVC 구성 요소는 교차일관성 정규화(CCR)와 비교해 더 낮은 비율의 확신 있는 잘못된 예측를 보이며 확인 편향을 감소시킴을 입증한다.
  • 충돌 기반 가짜 라벨링(CPL) 방법은 훈련을 안정화시키며, $\omega_c = 2.0$에서 모델 성능이 최고조에 도달하여 mIoU가 74.0%에 도달한다.
  • 시각화 결과는 노란색 상자 내부의 충돌 예측이 훈련 과정에서 점차 일관성 있게 변하는 것을 보여주며, CPL이 하위 네트워크 예측을 정렬하는 데 효과적임을 확인한다.
  • CVC는 CCR보다도 mIoU와 신뢰성 면에서 뛰어난 성능을 보이며, CCR가 더 많은 확신 있는 예측을 생성하지만 이는 종종 잘못된 경향이 있음에도 불구하고.
  • 이 방법은 일반적으로 CCR 및 베이스라인 모델이 놓치는 어려운 구분이 어려운 물체, 예를 들어 뒷바퀴나 작은 물체를 성공적으로 세분화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.