[논문 리뷰] All about Structure: Adapting Structural Information across Domains for Boosting Semantic Segmentation
이 논문은 영상 분할을 위한 비지도 도메인 적응을 향상시키기 위해 도메인 불변 구조와 도메인 특화 텍스처 성분으로 이미지 표현을 분리하는 도메인 불변 구조 추출(DISE) 프레임워크를 제안한다. 합성(GTA5) 및 실세계(Cityscapes) 도메인 간에 오직 구조 성분만을 정렬하고, 이미지 번역과 레이블 전이를 가능하게 함으로써 DISE는 Cityscapes에서 45.4 mIoU를 달성하여 최신 기법들보다 최대 4.3 mIoU 높은 성능을 보였다.
In this paper we tackle the problem of unsupervised domain adaptation for the task of semantic segmentation, where we attempt to transfer the knowledge learned upon synthetic datasets with ground-truth labels to real-world images without any annotation. With the hypothesis that the structural content of images is the most informative and decisive factor to semantic segmentation and can be readily shared across domains, we propose a Domain Invariant Structure Extraction (DISE) framework to disentangle images into domain-invariant structure and domain-specific texture representations, which can further realize image-translation across domains and enable label transfer to improve segmentation performance. Extensive experiments verify the effectiveness of our proposed DISE model and demonstrate its superiority over several state-of-the-art approaches.
연구 동기 및 목표
- 합성 데이터에서 학습된 모델을 실세계 이미지로 이식할 때 발생하는 도메인 민감도 문제를 해결하기 위해.
- 고수준의 구조적 콘텐츠와 저수준의 텍스처 차이를 분리함으로써 비지도 도메인 적응을 향상시키기 위해.
- 이미지 번역 과정에서 구조적 일관성을 유지함으로써 소스(합성) 도메인에서 타겟(실세계) 도메인으로 효과적인 레이블 전이를 가능하게 하기 위해.
- 도메인 불변 구조 학습과 이방향 이미지 번역을 모두 지원하는 통합 프레임워크를 개발하기 위해.
제안 방법
- DISE 프레임워크는 구조에 대해 공유 인코더와 텍스처에 대해 도메인 특화 인코더를 사용하여 분리된 표현 학습을 가능하게 한다.
- 각기 다른 인코더를 통해 입력 이미지를 도메인 불변 구조 코드와 도메인 특화 텍스처 코드로 분해한다.
- 공유 디코더를 사용하여 한 도메인의 구조 코드와 다른 도메인의 텍스처 코드를 조합함으로써 이미지 번역을 수행한다.
- 분할 헤드는 소스 도메인의 레이블로 학습되며, 번역된 소스 이미지로부터 유도된 가짜 레이블이 타겟 도메인의 보조 학습에 사용된다.
- 다양한 손실 함수를 적용한다: 분할 손실, 분할 예측에 대한 adversarial 손실, 재구성 손실, 그리고 구조 및 텍스처 번역에 대한 사이클 일관성 손실.
- 구조 코드에 대한 adversarial 훈련을 통해 도메인 불변 구조 정렬을 달성하고, 텍스처는 도메인 특화로 유지한다.

실험 결과
연구 질문
- RQ1고수준의 구조적 콘텐츠를 도메인 간에 불변으로 만들 수 있는가? 이는 영상 분할 일반화 성능 향상에 기여하는가?
- RQ2구조와 텍스처 성분을 분리함으로써 공동 특징 정렬보다 더 나은 도메인 적응 성능를 달성할 수 있는가?
- RQ3구조-텍스처 분리 기반의 이미지 간 번역이 합성 이미지에서 실세계 이미지로의 효과적인 레이블 전이를 가능하게 하는가?
- RQ4제안된 방법은 최신의 도메인 적응 기법들에 비해 분할 정확도 측면에서 어떻게 비교되는가?
주요 결과
- GTA5에서 훈련된 DISE 모델은 Cityscapes 데이터셋에서 45.4 mIoU를 달성하여 'Source Only' 기반선(39.8 mIoU)을 크게 초월한다.
- 제거 실험 결과, 레이블 전이 없이도 분리만으로도 성능이 44.1 mIoU로 향상되어, 구조-텍스처 분리의 가치를 입증한다.
- 'DISE w/o Label Transfer' 버전 대비 번역된 이미지 기반 레이블 전이가 추가로 1.3 mIoU 향상을 이끌어내어 그 효과를 입증한다.
- 정성적 결과에서는 구조는 유지하면서 텍스처만 도메인 간 이동이 가능한 고해상도의 이미지 번역이 가능함을 보여주며, 가짜 레이블 생성의 타당성을 뒷받침한다.
- 최신 기법인 Seg-map Adaptation에 비해 2.8 mIoU 높은 성능을 기록하여, 도메인 적응 분야에서의 우수성을 확인한다.
- 이 프레임워크는 하나의 아키텍처 안에서 도메인 불변 구조 학습과 이방향 이미지 번역을 모두 가능하게 하여, 영상 분할의 도메인 민감도 문제에 대한 통합적인 해결책을 제시한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.