[논문 리뷰] Unsupervised Domain Adaptation for Semantic Segmentation by Content Transfer
이 논문은 영상의 내용과 스타일을 분리하기 위한 제로스타일 손실을 사용하여 도메인 간 불일치를 줄이고, 합성 도메인에서 실제 도메인으로의 콘텐츠 전송을 통해 꼬리 클래스 성능을 향상시키는 비지도 도메인 적응(UDA) 방법을 제안한다. 이 방법은 도메인 간 불일치를 감소시키고 클래스 불균형 문제를 완화함으로써, GTA5→Cityscapes 및 SYNTHIA→Cityscapes 벤치마크에서 최고 성능을 기록한다.
In this paper, we tackle the unsupervised domain adaptation (UDA) for semantic segmentation, which aims to segment the unlabeled real data using labeled synthetic data. The main problem of UDA for semantic segmentation relies on reducing the domain gap between the real image and synthetic image. To solve this problem, we focused on separating information in an image into content and style. Here, only the content has cues for semantic segmentation, and the style makes the domain gap. Thus, precise separation of content and style in an image leads to effect as supervision of real data even when learning with synthetic data. To make the best of this effect, we propose a zero-style loss. Even though we perfectly extract content for semantic segmentation in the real domain, another main challenge, the class imbalance problem, still exists in UDA for semantic segmentation. We address this problem by transferring the contents of tail classes from synthetic to real domain. Experimental results show that the proposed method achieves the state-of-the-art performance in semantic segmentation on the major two UDA settings.
연구 동기 및 목표
- 비지도 도메인 적응(UDA)을 위한 영상 세분화에서 합성 이미지와 실제 이미지 간의 도메인 간 불일치 문제를 해결한다.
- 실제 데이터셋에서 클래스 불균형으로 인한 헤드 클래스에 대한 편향을 감소시킨다.
- 추가 애너테이션 없이도 타겟 도메인의 희귀(꼬리) 클래스에서의 세분화 성능을 향상시킨다.
- 합성 소스 레이블과 레이블이 없는 실제 데이터만을 사용하여 도메인 적응과 클래스 불균형 완화를 위한 엔드 투 엔드 학습을 가능하게 한다.
- 표준 UDA 벤치마크에서 영상 세분화 분야에서 최고 성능을 달성한다.
제안 방법
- 콘텐츠 인코더 하나와 스타일 인코더 두 개를 사용하여 콘텐츠와 스타일의 분리가 이루어지는 제로스타일 손실을 도입한다.
- 콘텐츠 인코더는 도메인에 영향을 받지 않는 특징을 추출하도록 학습하고, 스타일 인코더는 도메인에 특화된 특징을 학습한다.
- 사이클 일致성 학습을 적용하여 소스 도메인과 타겟 도메인 간의 특징 정렬을 향상시킨다.
- 입력 수준과 출력 수준의 콘텐츠 전송을 구현하여 희귀 클래스의 정확한 합성 애너테이션을 실제 도메인에 통합한다.
- 타겟 도메인에서 편의 레이블을 사용한 자기 학습을 수행하지만, 꼬리 클래스에 대한 신뢰도가 낮은 편의 레이블은 소스에서 전달된 콘텐츠로 대체하여 편향을 완화한다.
- 적대적 손실, 사이클 일치성, 콘텐츠 전송 감독을 조합하여 모델을 엔드 투 엔드로 최적화한다.
실험 결과
연구 질문
- RQ1영상의 콘텐츠와 스타일을 분리하면 비지도 도메인 적응에서 영상 세분화의 도메인 정렬 성능이 향상되는가?
- RQ2제로스타일 손실이 표준 적대적 또는 사이클 일치성 방법보다 특징 수준의 도메인 적응 성능을 향상시키는가?
- RQ3합성 데이터에서 실제 데이터로의 콘텐츠 전송은 추가 애너테이션 없이도 희귀(꼬리) 클래스의 세분화 성능을 향상시키는가?
- RQ4콘텐츠 전송은 편의 레이블을 사용한 자기 학습과 비교해 도메인 적응에서 클래스 불균형 문제를 얼마나 효과적으로 완화하는가?
- RQ5제안된 방법은 표준 합성-실제 도메인 UDA 벤치마크에서 최고 성능을 달성하는가?
주요 결과
- 제안된 방법은 GTA5→Cityscapes에서 mIoU 49.6%와 SYNTHIA→Cityscapes에서 mIoU 46.5%를 기록하여 이전의 모든 SOTA 방법을 능가한다.
- 입력 수준의 콘텐츠 전송을 통합함으로써, GTA5→Cityscapes의 mIoU_tail은 29.9%에서 31.5%로, SYNTHIA→Cityscapes의 mIoU_tail은 23.2%에서 26.3%로 향상된다.
- 출력 수준의 콘텐츠 전송을 추가로 적용하면, GTA5→Cityscapes에서 mIoU_tail은 33.3%로, mIoU는 49.6%로 향상되며, SYNTHIA→Cityscapes에서는 mIoU_tail이 27.2%로, mIoU는 46.5%로 향상된다.
- 자기 학습만을 수행할 경우, GTA5→Cityscapes와 SYNTHIA→Cityscapes에서 각각 mIoU_tail이 0.7%와 0.8% 감소하여 클래스 불균형이 악화됨을 확인한다.
- 정성적 결과에서는 콘텐츠 전송 이후 꼬리 클래스 객체(예: 교통 표지, 자전거)의 세분화가 향상되어 명확한 경계와 더 적은 오진을 보인다.
- 절단 분석 결과, 제로스타일 손실과 콘텐츠 전송이 모두 필수적인 구성 요소임을 확인하였으며, 둘을 함께 사용할 때 가장 높은 성능를 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.