[논문 리뷰] Semi-supervised Domain Adaptation based on Dual-level Domain Mixing for Semantic Segmentation
이 논문은 영역 간 특성 차이를 줄이고, 보조 학습을 통해 지속적으로 개선되는 두 개의 교사 모델을 학습하기 위해 영역 수준 및 샘플 수준의 데이터 혼합을 조합한 이중 수준 도메인 혼합 프레임워크를 제안한다. 이 방법은 도메인 간 특성 차이를 줄이고, 보조 학습을 통해 지속적으로 개선되는 두 개의 교사 모델을 학습한다. 이중 수준 혼합을 통해 GTA5에서 Cityscapes로의 도메인 적응에서 최신 기술 수준의 성능을 달성하며, 스타일 전이 없이도 기존 방법을 능가한다. 이는 반복적인 가짜 라벨 정련과 함께 교사 및 학생 모델을 점진적으로 향상시키는 자기 학습을 통해 달성된다.
Data-driven based approaches, in spite of great success in many tasks, have poor generalization when applied to unseen image domains, and require expensive cost of annotation especially for dense pixel prediction tasks such as semantic segmentation. Recently, both unsupervised domain adaptation (UDA) from large amounts of synthetic data and semi-supervised learning (SSL) with small set of labeled data have been studied to alleviate this issue. However, there is still a large gap on performance compared to their supervised counterparts. We focus on a more practical setting of semi-supervised domain adaptation (SSDA) where both a small set of labeled target data and large amounts of labeled source data are available. To address the task of SSDA, a novel framework based on dual-level domain mixing is proposed. The proposed framework consists of three stages. First, two kinds of data mixing methods are proposed to reduce domain gap in both region-level and sample-level respectively. We can obtain two complementary domain-mixed teachers based on dual-level mixed data from holistic and partial views respectively. Then, a student model is learned by distilling knowledge from these two teachers. Finally, pseudo labels of unlabeled data are generated in a self-training manner for another few rounds of teachers training. Extensive experimental results have demonstrated the effectiveness of our proposed framework on synthetic-to-real semantic segmentation benchmarks.
연구 동기 및 목표
- 제한된 타겟 도메인 라벨 데이터를 가진 합성(소스) 도메인에서 실세계(타겟) 도메인으로 전이할 때 발생하는 정신 분할 성능 격차를 해소한다.
- 라벨이 부족한 타겟 데이터와 풍부한 타겟 도메인의 라벨 없음 데이터를 활용하여, 무 supervision 도메인 적응과 보조 학습의 한계를 극복한다.
- 영역 수준 및 샘플 수준의 이중 수준 데이터 혼합을 도입하여 도메인 간 특성 불변성 학습을 장려함으로써 도메인 갭을 줄인다.
- 가짜 라벨 데이터를 사용한 반복적 자기 학습과 함께, 상호 보완적인 교사 모델로부터의 지식 전이를 통해 모델의 일반화 능력과 강건성을 향상시킨다.
- 표준 합성-실세계 벤치마크에서 제안된 프레임워크의 효과성을 입증하며, 최소한의 타겟 라벨 데이터로도 뛰어난 성능을 달성한다.
제안 방법
- 라벨이 부여된 소스 및 타겟 이미지에 두 개의 마스크를 적용하여 영역 수준 도메인 혼합을 제안하며, 이로써 구조적 불변성을 강조하는 혼합 샘플을 생성한다.
- 전체 소스 및 타겟 이미지를 직접 혼합하여 전체적인 도메인 간 불변 표현 학습을 장려하는 샘플 수준 도메인 혼합을 도입한다.
- 영역 수준 혼합 데이터에서 학습된 교사 모델과 샘플 수준 혼합 데이터에서 학습된 교사 모델을 각각 다른 도메인 갭 측면에 집중시켜 상호 보완적인 두 개의 교사 모델을 훈련한다.
- 지식 전이 기법을 사용하여 두 교사 모델의 지식을 하나의 학생 모델로 전이하며, '어두운 지식'을 활용하여 타겟 도메인에서의 일반화 능력을 향상시킨다.
- 학생 모델을 사용하여 타겟 도메인의 라벨 없음 데이터에 대해 가짜 라벨을 생성하고, 반복적인 자기 학습 루프를 통해 교사 모델을 재학습함으로써 교사 및 학생 모델을 점진적으로 정련한다.
- LAB 색상 공간에서 스타일 전이를 적용하여 시각적 도메인 갭을 추가로 줄이지만, 이 조치 없이도 프레임워크가 효과를 유지한다.
실험 결과
연구 질문
- RQ1영역 수준 및 샘플 수준에서 동시에 작용하는 이중 수준 도메인 혼합이 보조 학습 도메인 적응에서 정신 분할의 도메인 일반화 능력을 향상시키는가?
- RQ2다른 혼합 수준에서 학습된 두 개의 상호 보완적 교사 모델에서의 지식 전이가 단일 교사 또는 기준 방법에 비해 학생 모델의 성능에 어떤 영향을 미치는가?
- RQ3가짜 라벨 데이터를 사용한 반복적 자기 학습이 여러 라운드의 정련을 거치며 모델 성능을 얼마나 향상시키는가?
- RQ4스타일 전이를 적용하지 않은 상황에서도 제안된 프레임워크가 효과를 발휘하는가? 그리고 동일 조건에서 기존 방법(예: ASS)과 비교해 볼 때 어떤가?
- RQ5영역 수준 및 샘플 수준 혼합의 상호 보완적 강점은 특히 복잡하거나 특징적인 형태를 가진 다양한 정신 분할 카테고리에서 어떻게 나타나는가?
주요 결과
- 모든 라벨 데이터 설정에서 학생 모델이 개별 교사 모델을 항상 능가하며, 서로 다른 시각에서의 지식 전이 효과를 입증한다.
- GTA5에서 Cityscapes로의 벤치마크에서, 제안된 방법은 2975개의 타겟 라벨 이미지를 사용할 때 평균 IoU 69.8%를 달성하며, 스타일 전이 없이도 기존의 ASS 기준선을 능가한다.
- 이중 수준 혼합에서 유도된 모델 앙상블은 단일 시각 앙상블보다 더 뛰어난 성능을 보이며, fencing 및 rider와 같은 도전적인 카테고리에서 IoU가 향상된다.
- 영역 수준 혼합은 구조적 안정성이 높은 클래스(예: 도로, 보도, 식생)에서 가장 우수한 성능를 보이며, 샘플 수준 혼합은 형태 민감도가 높은 클래스(예: 버스, 신호등)에서 뛰어난 성능를 보여, 이들의 상호 보완적 성격을 확인한다.
- 반복적인 자기 학습 루프는 점진적인 향상을 이끌며, 학생 모델의 성능이 여러 라운드에 걸쳐 향상되고, 더 강력한 학생 모델이 더 정확한 가짜 라벨을 통해 교사 모델을 정련한다.
- 스타일 전이가 성능 향상에 기여하지만, 이 조치 없이도 프레임워크는 효과를 유지한다. 특히 도메인 번역 없이도 100~1000개의 라벨 이미지에서 최신 기술 수준의 성능를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.