Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Semantic Segmentation with a Strategic Curriculum of Proxy Labels

Kashyap Chitta, Jianwei Feng|arXiv (Cornell University)|2018. 11. 08.
Topic Modeling참고 문헌 27인용 수 15
한 줄 요약

이 논문은 생성된 도메인에서 실세계 도메인으로의 비지도 도메인 적응을 위한 전략적 커리큘럼을 제안한다. 이는 타겟 도메인의 프록시 레이블을 사용하며, 프록시 레이블이 부여된 타겟 데이터에서의 쉬운 샘플과 레이블이 부여된 소스 데이터에서의 어려운 샘플을 결합한다. 동적으로 균형 잡힌 이 샘플 조합으로 훈련하고, 예측 신뢰도를 평가하기 위해 듀얼 디코더 아키텍처를 사용함으로써, 적대적 특징 정렬 없이도 합성-실세계 적응 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Training deep networks for semantic segmentation requires annotation of large amounts of data, which can be time-consuming and expensive. Unfortunately, these trained networks still generalize poorly when tested in domains not consistent with the training data. In this paper, we show that by carefully presenting a mixture of labeled source domain and proxy-labeled target domain data to a network, we can achieve state-of-the-art unsupervised domain adaptation results. With our design, the network progressively learns features specific to the target domain using annotation from only the source domain. We generate proxy labels for the target domain using the network's own predictions. Our architecture then allows selective mining of easy samples from this set of proxy labels, and hard samples from the annotated source domain. We conduct a series of experiments with the GTA5, Cityscapes and BDD100k datasets on synthetic-to-real domain adaptation and geographic domain adaptation, showing the advantages of our method over baselines and existing approaches.

연구 동기 및 목표

  • 소스 도메인에서 훈련된 모델이 분포 이탈으로 인해 타겟 도메인으로 일반화 성능이 떨어지는 도메인 이격 문제를 해결하기 위해.
  • 타겟 도메인의 고비용 픽셀 수준 레이블링에 대한 의존도를 줄이기 위해, 타겟 도메인의 비라벨 데이터를 프록시 레이블링을 통해 활용하기 위해.
  • 소스 및 타겟 도메인에서의 쉬운 샘플과 어려운 샘플을 균형 있게 조합하는 커리큘럼 기반 훈련 전략을 통해 비지도 도메인 적응 성능을 향상시키기 위해.
  • 앙상블 협의 지도를 통해 샘플의 어려움을 효과적으로 추정할 수 있는 경량이고 비적대적 아키텍처를 개발하기 위해.
  • 명시적 특징 정렬 없이도 합성-실세계 및 도시 간 도메인 적응 벤치마크에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • 레이블이 부여된 소스 도메인 데이터와 프록시 레이블이 부여된 타겟 도메인 데이터의 혼합을 사용한 자기훈련을 통해 모델 일반화 성능을 반복적으로 향상시킨다.
  • 예측 협의가 브랜치 간에 생성되는 협의 지ap을 통해 샘플의 어려움을 추정하는 듀얼 디코더 아키텍처를 구현한다.
  • 예측 협의가 낮은(어려운) 샘플에 대한 업데이트를 방지하기 위해 기울기 필터링을 적용하여 신뢰할 수 있는 예측에 집중한다.
  • 소스 및 타겟 도메인 양쪽에서 클래스 불균형 문제를 해결하기 위해 클래스별 손실 가중치를 적용한다.
  • 전략적 커리큘럼 스케줄링을 적용: 점차적으로 타겟 도메인 데이터 비율을 늘리되, 쉬운 프록시 레이블이 부여된 샘플과 어려운 소스 레이블이 부여된 샘플을 우선순위로 한다.
  • 신뢰도 기반 샘플 마이닝—타겟 도메인의 쉬운 샘플과 소스 도메인의 어려운 샘플을 활용해 훈련 과정을 이끌어낸다.

실험 결과

연구 질문

  • RQ1프록시 레이블이 부여된 타겟 도메인 데이터와 소스 도메인에서의 어려운 샘플을 조합하는 커리큘럼 기반 훈련 전략이 비지도 도메인 적응에서 성능 향상에 기여하는가?
  • RQ2듀얼 디코더 협의를 통한 불확실성 추정이 자원이 제한된 적응 환경에서 모델의 강건성과 일반화 능력을 향상시키는가?
  • RQ3제안된 방법이 합성-실세계 및 도시 간 도메인 적응 과제에서 기존의 특징 정렬 기반 접근법을 능가하는가?
  • RQ4프록시 레이블링과 선택적 샘플 마이닝이 자기훈련 과정에서 오차 확산을 어느 정도 줄일 수 있는가?
  • RQ5소스 도메인과 타겟 도메인이 해상도와 콘텐츠 면에서 크게 다를 경우에도 이 방법이 BDD100k와 같은 다양한 타겟 도메인에 일반화 가능한가?

주요 결과

  • GTA5 → Cityscapes 벤치마크에서 mIoU가 48.4로 최신 기술 수준을 달성하였으며, 이는 단지 GTA5 레이블만을 사용한 모든 이전 비지도 도메인 적응 방법을 능가한다.
  • 19개 클래스 중 9개 클래스에서 기존 최고 성능 방법보다 IoU가 향상되었으며, 특히 차량과 사람과 같은 클래스에서 뚜렷한 성과 향상을 보였다.
  • 예측 협의를 기반으로 기울기를 필터링함으로써 자기훈련 중 오차 확산을 줄였고, 더 안정적인 수렴을 이끌어냈다.
  • 듀얼 디코더 협의 지도는 모호한 영역과 클래스 경계를 효과적으로 강조하여 모델 불확실성의 시각적 해석 가능성을 제공한다.
  • BDD100k에서도 경쟁 가능한 성능을 달성하였으며, GTA5에서의 적응이 Cityscapes에서의 적응보다 약간 더 높은 mIoU를 기록하여 합성-실세계 적응에 매우 적합함을 시사한다.
  • 이 방법은 CyCADA와 같은 적대적 특징 정렬 방법과 수직적 관계를 이루며, 향후 성능 향상을 위해 두 방법을 조합할 수는 있으나, 하이퍼파라미터 튜닝은 여전히 도전 과제이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.