[논문 리뷰] SePiCo: Semantic-Guided Pixel Contrast for Domain Adaptive Semantic Segmentation
SePiCo는 한 단계 도메인 적응형 세분화 프레임워크를 제안하며, 범주 중심점과 분포 인식 프로토타입을 사용하여 의미 지도형 픽셀 대비를 통해 자기 학습을 향상시킨다. 이는 다양한 도메인 간에 분류 기반으로 구분되는 표현을 학습함으로써, 무한한 (비)유사 픽셀 쌍을 닫힌 형식의 대비 손실을 통해 암묵적으로 모델링하여 일반화 능력과 학습 안정성을 크게 향상시킨다. 이로 인해 합성에서 실세계, 주간에서 야간으로의 벤치마크에서 최신 기술 성능을 달성한다.
Domain adaptive semantic segmentation attempts to make satisfactory dense predictions on an unlabeled target domain by utilizing the supervised model trained on a labeled source domain. In this work, we propose Semantic-Guided Pixel Contrast (SePiCo), a novel one-stage adaptation framework that highlights the semantic concepts of individual pixels to promote learning of class-discriminative and class-balanced pixel representations across domains, eventually boosting the performance of self-training methods. Specifically, to explore proper semantic concepts, we first investigate a centroid-aware pixel contrast that employs the category centroids of the entire source domain or a single source image to guide the learning of discriminative features. Considering the possible lack of category diversity in semantic concepts, we then blaze a trail of distributional perspective to involve a sufficient quantity of instances, namely distribution-aware pixel contrast, in which we approximate the true distribution of each semantic category from the statistics of labeled source data. Moreover, such an optimization objective can derive a closed-form upper bound by implicitly involving an infinite number of (dis)similar pairs, making it computationally efficient. Extensive experiments show that SePiCo not only helps stabilize training but also yields discriminative representations, making significant progress on both synthetic-to-real and daytime-to-nighttime adaptation scenarios.
연구 동기 및 목표
- 기존 도메인 적응 방법이 도메인 간 의미적 변동성을 다루는 데에 한계를 보이고 있으며, 내부 클래스의 밀도와 외부 클래스의 산산이 흩어지는 것을 忽시함으로써 특징의 구분 능력이 떨어지는 문제를 해결하기 위해.
- 도메인 간 픽셀 간 의미적 관계를 명시적으로 모델링하여 도메인 적응 세분화에서 자기 학습을 향상시키기 위해.
- 단계별 학습이나 복잡한 초기화에 의존하지 않고도 잘 정렬된, 클래스에 구분 가능한 균형 잡힌 픽셀 표현을 학습하기 위해.
- 닫힌 형식의 상한을 통해 암묵적으로 무한한 수의 (비)유사 픽셀 쌍을 포함하는 계산 효율적인 대비 손실을 개발하기 위해.
제안 방법
- 전체 소스 도메인의 글로벌 범주 프로토타입과 이미지별로 저장된 로컬 범주 중심점을 사용한 중심점 인식 픽셀 대비를 도입한다.
- 라벨이 지정된 소스 데이터로부터 각 의미적 범주의 통합 분포를 모델링하여 의미 정렬을 이끄는 분포 인식 픽셀 대비를 제안한다.
- 분포 인식 대비 손실에 대해 닫힌 형식의 상한을 유도하여, 명시적 음성 쌍 샘플링 없이도 효율적인 최적화를 가능하게 한다.
- 교사-학생 프레임워크에서 경량 투영 헤드를 사용하여 새로운 픽셀 임베딩 공간을 생성하며, 양 모델이 소스 및 타겟 이미지를 처리한다.
- 명시적 음성 쌍 샘플링 없이도 안정적인 최적화를 가능하게 하는 닫힌 형식의 상한을 유도하여, 명시적 음성 쌍 샘플링 없이도 안정적인 최적화를 가능하게 한다.
- 신뢰도 추정과 일致성 정규화를 사용하여 학습 중에 가짜 라벨를 정밀하게 보정함으로써 노이즈 예측에 대한 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1의미 지도형 픽셀 대비가 도메인 적응 세분화에서 특징의 구분 능력과 일반화 능력을 향상시킬 수 있는가?
- RQ2글로벌 및 로컬 범주 중심점을 통합함으로써 도메인 간 균형 잡힌 표현 학습에 어떤 영향을 미치는가?
- RQ3의미적 범주의 진정한 분포를 모델링하면 명시적 음성 샘플링 없이도 더 안정적이고 효과적인 대비 학습이 가능한가?
- RQ4의미 지도형 대비를 통한 한 단계 자기 학습 프레임워크가 정확도와 학습 효율성 측면에서 단계별 방법보다 우월한가?
- RQ5제안된 방법이 합성에서 실세계, 주간에서 야간과 같은 다양한 도메인 이동 시나리오에 얼마나 잘 일반화되는가?
주요 결과
- SePiCo는 DeepLab-V2를 사용하여 GTAV-to-Cityscapes 벤치마크에서 61.0 mIoU를 달성하여, Source Only(38.6 mIoU)와 DACS(52.1 mIoU)를 크게 앞서나간다.
- SegFormer-Mit-B5 기반의 더 도전적인 DAFormer 기반 설정에서 SePiCo는 70.3 mIoU를 기록하여 DAFormer(68.3 mIoU)과 Source Only(44.5 mIoU)를 초월한다.
- LogME 측정 기준으로 모델의 전이 능력이 향상되었으며, 모든 학습 단계에서 CAG-UDA와 ProDA보다 더 강력한 일반화 능력을 보였다.
- 처리 속도 분석 결과, SePiCo는 SegFormer-Mit-B5 기준으로 1.45초/반복의 소량의 계산 오버헤드만 추가하며, DAFormer(1.33초)와 비교해도 뛰어난 성능을 기록한다.
- 제거 실험 결과, 중심점 인식 및 분포 인식 대비 구성 요소 모두 성능 향상에 기여하며, 특히 분포 인식 대비가 가장 큰 기여를 했다.
- 대비 손실의 닫힌 형식 상한은 명시적 음성 마이닝이나 큰 메모리 오버헤드 없이도 안정적인 학습과 효율적인 최적화를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.