Skip to main content
QUICK REVIEW

[논문 리뷰] Perturbed and Strict Mean Teachers for Semi-supervised Semantic Segmentation

Yuyuan Liu, Yu Tian|arXiv (Cornell University)|2021. 11. 25.
Advanced Neural Network Applications참고 문헌 42인용 수 14
한 줄 요약

이 논문은 Pascal VOC 2012 및 Cityscapes 벤치마크에서 최고 성능을 기록한 새로운 반감독 세분화 방법인 Perturbed and Strict Mean Teachers (PS-MT)를 제안한다. 이 방법은 예측 정확도를 향상시키기 위해 보조 교사 모델과 신뢰도 가중 교차 엔트로피(Conf-CE) 손실을 도입하여 일致 학습을 향상시킨다. 더 신뢰할 수 있는 가짜 라벨을 가능하게 함으로써, 도전적인 네트워크, 입력, 그리고 적대적 특징 편향(특히 T-VAT)을 효과적으로 활용할 수 있게 되었으며, 이는 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Consistency learning using input image, feature, or network perturbations has shown remarkable results in semi-supervised semantic segmentation, but this approach can be seriously affected by inaccurate predictions of unlabelled training images. There are two consequences of these inaccurate predictions: 1) the training based on the "strict" cross-entropy (CE) loss can easily overfit prediction mistakes, leading to confirmation bias; and 2) the perturbations applied to these inaccurate predictions will use potentially erroneous predictions as training signals, degrading consistency learning. In this paper, we address the prediction accuracy problem of consistency learning methods with novel extensions of the mean-teacher (MT) model, which include a new auxiliary teacher, and the replacement of MT's mean square error (MSE) by a stricter confidence-weighted cross-entropy (Conf-CE) loss. The accurate prediction by this model allows us to use a challenging combination of network, input data and feature perturbations to improve the consistency learning generalisation, where the feature perturbations consist of a new adversarial perturbation. Results on public benchmarks show that our approach achieves remarkable improvements over the previous SOTA methods in the field. Our code is available at https://github.com/yyliu01/PS-MT.

연구 동기 및 목표

  • 반감독 세분화의 일치 학습에서 정확도가 떨어지는 예측 문제를 해결함으로써 확증 편향을 방지하고 일반화 성능을 향상시키기 위해.
  • 새로운 보조 교사 모델과 더 엄격한 손실 함수를 통해 교사 모델의 예측 정확도를 향상시켜, 미라벨 이미지의 가짜 라벨 신뢰도를 높이기 위해.
  • 높은 예측 신뢰도를 기반으로 다양한 편향(네트워크, 입력 이미지, 특징 수준)을 조합하여 일치 정규화의 효과를 극대화하기 위해.
  • 다수의 교사 모델에서 학습한 지식을 활용하여 강력하고 도전적인 노이즈를 생성하는 새로운 적대적 특징 편향 방법(T-VAT)을 개발하기 위해.

제안 방법

  • 미라벨 이미지에서의 예측 신뢰도를 향상시키기 위해 보조 교사 모델을 도입한 이중 교사 평균-교사 아키텍처를 도입한다.
  • 평균-교사의 원래 평균 제곱오차(MSE) 손실을 더 엄격한 신뢰도 가중 교차 엔트로피(Conf-CE) 손실로 대체하여 학습 수렴을 향상시키고 예측 오류에 대한 과적합을 줄인다.
  • 교사의 예측에서 유도된 적대적 노이즈를 생성하여 학생의 특징을 편향시키는 새로운 특징 편향 방법인 T-VAT(Teacher-based Virtual Adversarial Training)를 도입한다.
  • 네트워크, 입력 이미지, 특징 수준의 편향을 조합한 다중 모odal 편향 전략을 적용하여 일치 정규화를 강화한다.
  • 교사의 저신뢰도 예측을 처리하기 위해 CAM 기반 가짜 라벨링 손실(식 9)을 사용하여 훈련 신호의 품질을 향상시킨다.
  • 일致 학습, Conf-CE, 가짜 라벨링 목표를 통합한 손실을 사용하여 학생 모델을 훈련함으로써 일반화 성능을 최적화한다.

실험 결과

연구 질문

  • RQ1평균-교사 모델에서 교사 예측의 정확도를 향상시키는 것이 반감독 세분화의 일치 학습 성능 향상에 기여하는가?
  • RQ2MSE 손실을 신뢰도 가중 교차 엔트로피(Conf-CE) 손실로 대체하면 학습 수렴이 향상되고 잘못된 가짜 라벨에 대한 과적합이 감소하는가?
  • RQ3높은 예측 신뢰도를 기반으로 네트워크, 입력, 적대적 특징 편향을 조합하면 모델의 일반화 성능 향상에 상당한 기여를 하는가?
  • RQ4다수의 교사 모델에서 학습한 T-VAT과 표준 특징 공간 노이즈 주입 방식은 일치 학습에서 어떻게 비교되는가?
  • RQ5CAM 기반 가짜 라벨링 손실을 Conf-CE 손실과 통합하면 표준 벤치마크에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • PS-MT는 DeeplabV3+ 백본과 ResNet101을 사용하여 Pascal VOC 2012에서 새로운 최고 성능(mIoU 81.19%)을 달성하였다.
  • DeeplabV3+ ResNet101 아키텍처에서 CAM 손실을 Conf-CE 손실과 조합했을 때 기준 모델 대비 mIoU가 1.18% 향상되었다.
  • Conf-CE 손실은 MSE보다 훨씬 큰 기울기 크기를 보이며, 더 강력한 최적화 역학과 더 나은 수렴을 의미한다.
  • 모델 예측 후 CutMix를 적용하면 mIoU가 약 3% 향상되며, 이는 데이터 증강 전략에서 예측 품질의 중요성을 입증한다.
  • 제안된 적대적 특징 편향인 T-VAT은 표준 특징 편향보다 더 효과적인 노이즈를 생성함으로써 모델의 강건성과 일반화 성능을 향상시킨다.
  • 정성적 결과에서는 PS-MT가 감독 기반 기준 모델과 학생 모델 전용 모델보다 더 정확한 세분화 맵을 생성함을 확인하여, 교사-학생 정밀 조정의 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.