[논문 리뷰] ProCST: Boosting Semantic Segmentation Using Progressive Cyclic Style-Transfer
이 논문은 합성 이미지에서 실세계 이미지로의 고해상도, 콘텐츠 유지 성능을 보장하는 이미지 번역(SiT, Source-in-Target)을 생성하기 위해 점진적 순환 스타일 전이를 사용하는 이단계 프레임워크 ProCST를 제안한다. 도메인 갭을 줄이기 위해, ProCST는 새로운 순환 레이블 손실을 사용하여 다중 척도 네트워크를 훈련시켜 HRDA, DAFormer, ProDA와 같은 후행 UDA 방법의 성능을 향상시키며, GTA5→Cityscapes 및 Synthia→Cityscapes 벤치마크에서 최신 기준(mIoU)을 달성한다.
Using synthetic data for training neural networks that achieve good performance on real-world data is an important task as it can reduce the need for costly data annotation. Yet, synthetic and real world data have a domain gap. Reducing this gap, also known as domain adaptation, has been widely studied in recent years. Closing the domain gap between the source (synthetic) and target (real) data by directly performing the adaptation between the two is challenging. In this work, we propose a novel two-stage framework for improving domain adaptation techniques on image data. In the first stage, we progressively train a multi-scale neural network to perform image translation from the source domain to the target domain. We denote the new transformed data as "Source in Target" (SiT). Then, we insert the generated SiT data as the input to any standard UDA approach. This new data has a reduced domain gap from the desired target domain, which facilitates the applied UDA approach to close the gap further. We emphasize the effectiveness of our method via a comparison to other leading UDA and image-to-image translation techniques when used as SiT generators. Moreover, we demonstrate the improvement of our framework with three state-of-the-art UDA methods for semantic segmentation, HRDA, DAFormer and ProDA, on two UDA tasks, GTA5 to Cityscapes and Synthia to Cityscapes.
연구 동기 및 목표
- 합성(소스) 이미지와 실세계(타겟) 이미지 간의 도메인 갭을 해결함으로써, 합성 데이터로만 훈련할 경우 성능 저하 문제를 완화한다.
- 직접적인 도메인 적응 및 기존의 이미지 간 번역 방법이 스타일 전이 과정에서 콘텐츠를 왜곡하거나 환영을 생성하는 데서 비롯되는 한계를 극복한다.
- 소스 애너테이션을 유지하면서도 타겟 도메인의 외관을 모방하는 고품질, 콘텐츠 유지 성능을 보장하는 이미지 번역(SiT)을 생성하는 방법을 개발한다.
- 기존의 비지도 도메인 적응(UDA) 방법의 성능을 향상시키기 위해, 원시 소스 데이터 대신 생성된 SiT 데이터를 입력으로 사용한다.
제안 방법
- 이중 단계 프레임워크 제안: 첫 번째 단계에서 소스 이미지를 타겟 도메인으로 변환하는 점진적 순환 스타일 전이 네트워크(ProCST)를 훈련하여 SiT 데이터를 생성하고, 두 번째 단계에서 이러한 SiT 데이터를 표준 UDA 방법의 입력으로 사용한다.
- 양방향 이미지 피라미드 아키텍처를 설계하여 소스에서 타겟(S→T) 및 타겟에서 소스(T→S)로의 번역을 수행함으로써 순환 일관성을 확보한다.
- 소스 이미지와 그 번역된 SiT 복제본의 세그멘테이션 맵을 비교하여 의미 일관성을 강제하는 새로운 순환 레이블 손실을 도입한다.
- 적대적 손실, 순환 일관성 손실, 인지적 손실과 함께 순환 레이블 손실을 조합하여 콘텐츠 유지 및 시각적 현실감을 향상시킨다.
- 크기 척도에 따라 점진적으로 훈련을 수행하여, 굵은 척도에서 미세한 척도로 나아가는 방식으로 훈련 안정성과 특징 학습을 향상시킨다.
- 생성된 SiT 데이터를 최신 UDA 모델들(HRDA, DAFormer, ProDA 등)의 사전 처리된 입력으로 사용하여, 실세계 타겟 도메인으로의 적응 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1기존의 이미지 간 번역 방법에 비해 점진적 다중 척도 스타일 전이 네트워크가 합성 이미지와 실세계 이미지 간의 도메인 갭을 더 효과적으로 줄일 수 있는가?
- RQ2순환 레이블 손실이 기존의 GAN 기반 접근 방식에 비해 스타일 전이 과정에서 콘텐츠 유지 성능을 크게 향상시키는가?
- RQ3ProCST가 생성한 SiT 데이터를 사용할 경우, 후행 UDA 방법의 의미 분할 성능은 어느 정도 향상되는가?
- RQ4핵심 구성 요소(예: 레이블 손실, 다중 척도 구조)의 아블레이션 분석을 통해 번역된 이미지의 품질과 최종 세그멘테이션 정확도에 어떤 영향을 미치는가?
주요 결과
- ProCST는 합성 이미지와 실세계 이미지 간의 도메인 갭을 크게 줄이며, 소스 콘텐츠를 유지하면서도 타겟 도메인의 외관을 반영한 SiT 이미지를 생성한다.
- 모든 아블레이션 버전(레이블 손실 제거, 단일 척도)보다 전체 ProCST 모델이 시각적 품질, 텍스처 정확도, 의미 일관성 측면에서 뛰어난 성능을 보이며, 특히 도로와 같은 복잡한 텍스처에서 두드러진다.
- HRDA, DAFormer, ProDA와 같은 선도적인 UDA 방법과 비교할 때, ProCST가 생성한 SiT 데이터를 통합함으로써 GTA5→Cityscapes 및 Synthia→Cityscapes 벤치마크에서 일관된 mIoU 향상이 이루어진다.
- 기존의 이미지 간 번역 방법(CycleGAN, CUT, FDA 등)은 콘텐츠 유지 성능에 실패하여 종종 객체를 왜곡하거나 환영을 생성함으로써 소스 애너테이션을 무효화한다.
- 순환 레이블 손실은 핵심 요소이다. 이 손실이 없는 모델은 외관적으로는 유사해 보이지만 의미적으로 일관성이 없는 출력을 생성하여 후속 세그멘테이션 성능을 저하시킨다.
- 다중 척도 아키텍처는 특징 학습과 텍스처 전달 성능을 향상시키며, 특히 도로나 하늘과 같은 도전적인 영역에서 단일 척도 모델이 현실감을 유지하지 못하는 데서 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.