Skip to main content
QUICK REVIEW

[논문 리뷰] Iterative Loop Method Combining Active and Semi-Supervised Learning for Domain Adaptive Semantic Segmentation

Licong Guan, Yuan Xue|arXiv (Cornell University)|2023. 01. 31.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 도메인 적응형 세분화를 위한 반복적 루프 방법인 ILM-ASSL을 제안한다. 이 방법은 준감독 학습과 능동 학습을 결합하여, 먼저 준감독 학습을 통해 타겟 도메인의 비라벨 데이터를 활용하여 모델 정확도를 향상시키고 노이즈가 많은 가짜 라벨을 줄인다. 이후 예측 불확실성 기반의 능동 학습을 적용하여 중요도가 높은 샘플을 선별하고 수정함으로써 최소한의 라벨링 비용으로 최신 기술 수준의 성능을 달성한다. 이로써 GTAV→Cityscapes 및 SYNTHIA→Cityscapes에서 각각 mIoU를 4.9%와 5.2% 향상시켰다.

ABSTRACT

Semantic segmentation is an important technique for environment perception in intelligent transportation systems. With the rapid development of convolutional neural networks (CNNs), road scene analysis can usually achieve satisfactory results in the source domain. However, guaranteeing good generalization to different target domain scenarios remains a significant challenge. Recently, semi-supervised learning and active learning have been proposed to alleviate this problem. Semisupervised learning can improve model accuracy with massive unlabeled data, but some pseudo labels containing noise would be generated with limited or imbalanced training data. And there will be suboptimal models if human guidance is absent. Active learning can select more effective data to intervene, while the model accuracy can not be improved because the massive unlabeled data are not used. And the probability of querying sub-optimal samples will increase when the domain difference is too large, increasing annotation cost. This paper proposes an iterative loop method combining active and semisupervised learning for domain adaptive semantic segmentation. The method first uses semi-supervised to learn massive unlabeled data to improve model accuracy and provide more accurate selection models for active learning. Secondly, combined with the predictive uncertainty sample selection strategy of active learning, manual intervention is used to correct the pseudo-labels. Finally, flexible iterative loops achieve the best performance with minimal labeling cost. Extensive experiments show that our method establishes state-of-the-art performance on tasks of GTAV to Cityscapes, SYNTHIA to Cityscapes, improving by 4.9% mIoU and 5.2% mIoU, compared to the previous best method, respectively.

연구 동기 및 목표

  • 소스 도메인에서 타겟 도메인으로 모델을 이식할 때 발생하는 도메인 분리 현상으로 인한 일반화 능력 저하 문제를 해결한다.
  • 실세계 타겟 도메인에서 인간 라벨링이 필요한 데이터의 높은 라벨링 비용을 줄이면서도 높은 모델 성능을 유지한다.
  • 단독으로 사용할 경우의 준감독 학습(노이즈가 많은 가짜 라벨)과 능동 학습(비라벨 데이터의 잠재적 활용 부족)의 한계를 극복한다.
  • 기존의 라벨링 도구(예: Labelme)와 호환되는 실용적인 이미지 수준의 샘플 선택 전략을 개발하며, 최소 선택 단위로 단일 이미지를 사용한다.
  • 최소한의 인간 간섭과 라벨링 예산으로 도메인 적응형 세분화 분야에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 대규모 비라벨 타겟 도메인 데이터를 활용하기 위해 준감독 학습(SSL)을 적용하여 모델 정확도를 향상시키고 더 신뢰할 수 있는 가짜 라벨을 생성한다.
  • 예측 불확실성 기반의 샘플 선택 전략과 능동 학습을 통합하여 인간 라벨링에 가장 적합한 이미지를 식별하고 우선순위를 정한다.
  • 불확실한 샘플에 대한 인간 라벨링 수정을 통해 가짜 라벨를 정밀하게 다듬고 모델을 재학습시켜 노이즈를 줄이고 일반화 능력을 향상시킨다.
  • 준감독 학습과 능동 학습을 번갈아가며 반복하는 루프를 구현하여, 비라벨 데이터에 대한 자기 학습과 인간이 개입하는 고불확실성 샘플의 정밀 보정을 반복한다.
  • 기존의 라벨링 도구(예: Labelme)와 호환되는 실용적인 이미지 수준의 선택 메커니즘을 설계하여 픽셀 수준의 선택을 피하고, 실세계 워크플로우에서 비현실적인 작업을 방지한다.
  • DeepLab-V3+에 ResNet-101 백본을 사용하고, 비라벨 데이터에 대한 손실 함수(ℒu)와 일관성 정규화 손실 함수(ℒc)를 통합하여 훈련을 안정화시킨다.

실험 결과

연구 질문

  • RQ1준감독 학습과 능동 학습을 조합함으로써 도메인 적응형 세분화에서 라벨링 비용을 줄이고 성능을 향상시킬 수 있는가?
  • RQ2불확실한 샘플에서 인간이 수정한 가짜 라벨를 반복적으로 정밀하게 다듬는 방식이 도메인 분리 상황에서의 모델 일반화 능력에 어떤 영향을 미치는가?
  • RQ3실세계 라벨링 워크플로우에서 예측 불확실성 기반의 실용적인 이미지 수준의 선택 전략이 픽셀 수준의 선택 전략보다 얼마나 뛰어나게 성능을 발휘할 수 있는가?
  • RQ4제안된 방법이 GTAV→Cityscapes 및 SYNTHIA→Cityscapes와 같은 표준 벤치마크에서 최소한의 라벨링 예산으로 최신 기술 수준의 성능을 달성하는가?
  • RQ5오픈 세트 및 소스 프리 도메인 적응과 같은 도전적인 설정에서 이 방법의 강건성은 어떠한가?

주요 결과

  • ILM-ASSL은 GTAV→Cityscapes 벤치마크에서 78.1%의 mIoU를 달성하여 이전 최신 기술 수준의 방법보다 4.9% 향상되었다.
  • SYNTHIA→Cityscapes 벤치마크에서는 81.1%의 mIoU를 기록하여 이전 최고 성능 방법보다 5.2% 향상되었다.
  • 절단 실험 결과, 준감독 학습, 일관성 정규화, 능동 학습 각각의 구성 요소가 상당한 기여를 하며, 전체 방법은 베이스라인 대비 10.38% 향상된 성능을 보였다.
  • t-SNE 시각화 결과, ILM-ASSL이 RIPU와 같은 기존의 베이스라인 방법보다 더 구분력 있고 잘 분리된 특징 표현을 학습하는 것으로 나타났다.
  • 소스 프리 도메인 적응 상황에서도 잘 일반화되며, URMA, LD, SFDA, RIPU와 같은 기존 최신 기술 수준의 방법들을 초월하는 성능을 보였다.
  • 타겟 도메인 데이터의 단지 2.2%만 라벨링된 상태에서도 ILM-ASSL은 76.11%의 mIoU를 달성하여 높은 라벨링 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.