Skip to main content
QUICK REVIEW

[논문 리뷰] GuidedMix-Net: Learning to Improve Pseudo Masks Using Labeled Images as Reference

Peng Tu, Yawen Huang|arXiv (Cornell University)|2021. 06. 29.
Advanced Vision and Imaging참고 문헌 47인용 수 4
한 줄 요약

GuidedMix-Net은 특징 정렬과 상호 정보 전달을 통해 라벨된 이미지를 참조로 활용하여 가짜 마스크 품질을 향상시키는 새로운 준지도 학습 세그멘테이션 방법을 제안한다. 라벨된 및 라벨되지 않은 이미지 쌍으로부터 혼합 입력을 생성하고 지식 distillation을 통해 특징을 보완함으로써 최신 기술 수준의 성능을 달성하며, 기준 데이터셋에서 이전 방법 대비 mIoU를 +7% 향상시킨다.

ABSTRACT

Semi-supervised learning is a challenging problem which aims to construct a model by learning from a limited number of labeled examples. Numerous methods have been proposed to tackle this problem, with most focusing on utilizing the predictions of unlabeled instances consistency alone to regularize networks. However, treating labeled and unlabeled data separately often leads to the discarding of mass prior knowledge learned from the labeled examples, and failure to mine the feature interaction between the labeled and unlabeled image pairs. In this paper, we propose a novel method for semi-supervised semantic segmentation named GuidedMix-Net, by leveraging labeled information to guide the learning of unlabeled instances. Specifically, we first introduce a feature alignment objective between labeled and unlabeled data to capture potentially similar image pairs and then generate mixed inputs from them. The proposed mutual information transfer (MITrans), based on the cluster assumption, is shown to be a powerful knowledge module for further progressive refining features of unlabeled data in the mixed data space. To take advantage of the labeled examples and guide unlabeled data learning, we further propose a mask generation module to generate high-quality pseudo masks for the unlabeled data. Along with supervised learning for labeled data, the prediction of unlabeled data is jointly learned with the generated pseudo masks from the mixed data. Extensive experiments on PASCAL VOC 2012, PASCAL-Context and Cityscapes demonstrate the effectiveness of our GuidedMix-Net, which achieves competitive segmentation accuracy and significantly improves the mIoU by +7$\%$ compared to previous state-of-the-art approaches.

연구 동기 및 목표

  • 기존 준지도 학습 방법들이 라벨된 데이터와 라벨되지 않은 데이터를 별도로 다루어 라벨된 예제에서의 사전 지식을 활용하지 못하는 한계를 해결한다.
  • 수동적인 변형에 의존하는 일관성 기반 방법의 열악한 성능을 극복하고, 데이터 간의 구조적 및 의미적 관계를 효과적으로 포착하지 못하는 문제를 해결한다.
  • 라벨된 데이터에서 라벨되지 않은 인스턴스로 특징 수준의 상호작용과 지식 전달을 가능하게 하여 라벨되지 않은 데이터의 가짜 마스크 품질을 향상시킨다.
  • 라벨된 데이터와 라벨되지 않은 데이터를 혼합된 데이터 공간 표현을 통해 동시에 최적화하는 통합 학습 프레임워크를 개발한다.
  • 제한된 라벨된 데이터와 고품질의 가짜 마스크를 활용하여 라벨링 비용을 크게 줄이고도 경쟁적인 세그멘테이션 정확도를 달성한다.

제안 방법

  • 라벨된 이미지와 라벨되지 않은 이미지 쌍 간의 유사한 특징를 식별하고 정렬하기 위한 특징 정렬 목적함수를 도입하여 관련 참조 샘플의 선택을 가능하게 한다.
  • 정렬된 라벨된 이미지와 라벨되지 않은 이미지 쌍의 특징과 입력을 조합하여 혼합 입력을 구성함으로써 일반화 능력을 향상시키기 위한 하이브리드 데이터 공간을 구축한다.
  • 클러스터 가정에 기반한 상호 정보 전달(MITrans)이라는 지식 distillation 모듈을 제안하여 라벨된 지식을 활용해 라벨되지 않은 특징을 점진적으로 개선한다.
  • 혼합된 데이터 공간을 활용하고 라벨된 마스크에서의 분포 이탈을 최소화함으로써 라벨되지 않은 데이터에 대해 고품질의 가짜 마스크를 생성하는 마스크 생성 모듈을 설계한다.
  • 라벨된 데이터에 대해 지도 학습 손실과 라벨되지 않은 샘플의 원본 및 혼합 입력 예측 간 일관성 손실을 함께 사용하여 모델을 엔드 투 엔드로 학습시킨다.
  • 추가적인 라벨된 데이터 없이도 성능을 향상시키기 위해 추론 단계에서 다중 척도 테스트와 플립 증강 기법을 적용한다.

실험 결과

연구 질문

  • RQ1준지도 학습 세그멘테이션에서 라벨된 이미지를 참조로 활용하여 라벨되지 않은 데이터의 가짜 마스크 품질을 효과적으로 향상시킬 수 있는가?
  • RQ2라벨된 데이터에서 유도된 구조적 및 의미적 정보를 어떻게 라벨되지 않은 데이터로 전달하여 특징 표현과 세그멘테이션 정확도를 향상시킬 수 있는가?
  • RQ3라벨된 데이터와 라벨되지 않은 데이터 간의 상호 정보 전달이 표준 일관성 정규화를 넘어서 모델의 강건성과 일반화 능력을 향상시킬 수 있는가?
  • RQ4라벨된 데이터와 라벨되지 않은 데이터를 동시에 최적화하는 통합 학습 목표는 별도로 처리하는 방법보다 얼마나 뛰어난 성능을 낼 수 있는가?
  • RQ5제한된 라벨된 데이터만을 사용할 때 제안된 방법은 완전히 지도 학습된 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • PASCAL VOC 2012, PASCAL-Context 및 Cityscapes에서 준지도 학습 설정 하에 기존 최고 성능 방법 대비 +7% mIoU 향상을 달성한다.
  • 라벨된 데이터의 1/8만을 사용할 경우 PASCAL VOC 2012에서 75.2 mIoU를 기록하며, 전체 데이터로 학습된 완전 지도 학습 FCN(69.9 mIoU)을 초월한다.
  • 라벨된 데이터의 1/2를 사용할 경우 77.1 mIoU를 달성하여, 동일한 분할에서 완전 지도 학습 DeepLabV3+(78.6 mIoU)의 성능에 가까이 접근한다.
  • 다중 척도 테스트 및 플립 증강을 적용하면 1/2 라벨에서 78.2 mIoU를 기록하며, 반으로 줄어든 라벨된 데이터로도 DeepLabV3+(78.6 mIoU)에 매우 가까운 성능을 낸다.
  • PASCAL-Context에서 1/8 및 1/4 라벨된 데이터 사용 시 각각 14.2% 및 10.3%의 mIoU 향상을 달성하여 복잡하고 개방형 어휘 환경에서도 강력한 일반화 능력을 입증한다.
  • 시각적 비교 결과, CCT과 같은 일관성 기반 기준 모델 대비 GuidedMix-Net은 윤곽선 및 객체 경계 예측에서 더 정확하고 세밀한 가짜 마스크를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.