[논문 리뷰] Multi-domain semantic segmentation with pyramidal fusion
이 논문은 다양한 데이터셋 간 클래스 분포가 상이한 문제를 다루기 위해 ResNet-152 백본 기반의 피라미드형 특징 융합을 사용하는 다중 도메인 의미 분할 모델을 제안한다. 경계 인식형 포화 가중치를 갖는 새로운 로그-합-확률 손실을 도입하여, VIPER에서 62.5% mIoU, WildDash 2에서 45.4%를 기록하며 분포 외 데이터 벤치마크에서 최신 기술 수준 성능을 달성하였으며, 도메인 특화 최적화를 최소화하면서도 다양한 도메인 간 강건성을 유지를 이루었다.
We present our submission to the semantic segmentation contest of the Robust Vision Challenge held at ECCV 2020. The contest requires submitting the same model to seven benchmarks from three different domains. Our approach is based on the SwiftNet architecture with pyramidal fusion. We address inconsistent taxonomies with a single-level 193-dimensional softmax output. We strive to train with large batches in order to stabilize optimization of a hard recognition problem, and to favour smooth evolution of batchnorm statistics. We achieve this by implementing a custom backward step through log-sum-prob loss, and by using small crops before freezing the population statistics. Our model ranks first on the RVC semantic segmentation challenge as well as on the WildDash 2 leaderboard. This suggests that pyramidal fusion is competitive not only for efficient inference with lightweight backbones, but also in large-scale setups for multi-domain application.
연구 동기 및 목표
- 다양한 레이블과 분포를 가진 다수의 의미 분할 데이터셋에 대해 일반화할 수 있는 단일 딥러닝 모델을 개발하는 것.
- ADE20K, Cityscapes, VIPER, ScanNet 등의 데이터셋 간 도메인 이동 및 클래스 모호성 문제를 해결하는 것.
- 희귀 또는 겹치는 클래스 상황에서 특히 분포 외 데이터(OOD)에 대한 성능 향상.
- 경계 오류와 클래스 겹침에 대한 모델 강건성을 향상시키는 손실 함수 설계.
- 다양한 스케일의 표현 간 효과적인 특징 융합을 통해 의미 분할 정확도 향상.
제안 방법
- 모델는 다중 스케일의 문맥 표현을 통합하기 위해 피라미드형 특징 융합을 사용하는 SwiftNet ResNet-152 백본을 활용한다.
- 모든 데이터셋 간 겹치거나 부분 집합인 클래스를 통합, 추상화 또는 분할함으로써 유니버설 레이블 세트를 구성하여 의미 공간을 통일한다.
- 제안된 로그-합-확률 손실은 음의 로그우도와 예측 신뢰도 및 경계 인식 기반의 지수 가중치를 조합한다.
- 손실 함수는 동적 가중치 방식을 사용한다: $ L^{ij} = -\alpha^{ij} e^{\gamma(1-p^{ij})} \log p^{ij} $, 여기서 $ p^{ij} $ 는 픽셀 $ (i,j) $ 에 대해 모든 유니버설 클래스에 대한 확률의 합이다.
- 클래스 수준의 병합 및 분할을 통해 갈등을 해결한다: 정확한 일치 클래스는 병합하고, 부분 집합은 추상화하며, 겹치는 클래스는 상호 배타적인 구성 요소로 분해한다.
- 학습은 수평 반전, 스케일 저편, 자르기 등의 데이터 증강, 코스인 안내를 사용하는 Adam 최적화, 6× V100 GPU에서의 기울기 누적 기법을 사용한다.
실험 결과
연구 질문
- RQ1일관되지 않은 클래스 레이블을 가진 다양한 의미 분할 데이터셋에서 강력한 성능을 내는 단일 딥러닝 모델을 개발할 수 있는가?
- RQ2부분 집합 또는 겹치는 클래스와 같은 클래스 수준의 갈등은 어떻게 해결하여 다중 도메인 의미 분할을 통일할 수 있는가?
- RQ3경계 인식형 로그-합-확률 손실은 분포 외 데이터에서 의미 분할의 강건성을 얼마나 향상시키는가?
- RQ4피라미드형 특징 융합은 다중 스케일의 문맥 통합을 향상시키고, 교차 도메인 환경에서의 일반화를 향상시키는가?
- RQ5희귀 또는 모호한 클래스에서, 특히 WildDash 2와 WDv2와 같은 OOD 시나리오에서 모델의 성능은 어떠한가?
주요 결과
- VIPER 데이터셋에서 62.5% mIoU를 기록하여 이전 최신 기술 수준(40.7%)을 크게 초월하였다.
- WildDash 2에서 45.4% mIoU를 달성하여 다음으로 좋은 방법(37.9%)보다 7.5% 포인트 높았다.
- 모델는 높은 강건성을 보였으며, MVD에서 총 455억 픽셀 중 0.04%의 픽셀만 잘못 분류되어 분포 외 일반화 능력이 뛰어났다.
- ScanNet에서 54.6% mIoU를 기록하여 기준 모델인 MSeg1080_RVC 대비 6.1% 향상되었다.
- 초기 학습 단계에서 384×384 입력 해상도에서 45 FPS의 높은 추론 속도를 유지하였다.
- 손실 함수는 경계 영역에서 오류를 효과적으로 줄였으며, WildDash 2의 음성 픽셀에서 32.5% IoU를 기록하여 모호하거나 희귀한 클래스 처리 능력 향상을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.