[논문 리뷰] DANNet: A One-Stage Domain Adaptation Network for Unsupervised Nighttime Semantic Segmentation
이 논문은 도메인 적응을 위한 단계별(one-stage) 네트워크인 DANNet을 제안한다. 이는 일광 주행 데이터셋(Cityscapes)의 레이블을 기반으로 야간 환경으로의 적응을 위해, 일-야간 이미지 쌍의 근사적인 정렬과 적대적 훈련을 활용한 의사 supervision을 도입한다. 이로써 사전 학습된 이미지 번역 모델 없이도 야간 세분화 성능을 향상시키며, 재조명, 다중 타깃 적응, 손실 재가중 전략을 통해 소형 객체의 세분화 성능을 햖थ한다. 이는 Dark Zurich 및 Nighttime Driving 벤치마크에서 최신 기술 수준(SOTA)을 달성한다.
Semantic segmentation of nighttime images plays an equally important role as that of daytime images in autonomous driving, but the former is much more challenging due to poor illuminations and arduous human annotations. In this paper, we propose a novel domain adaptation network (DANNet) for nighttime semantic segmentation without using labeled nighttime image data. It employs an adversarial training with a labeled daytime dataset and an unlabeled dataset that contains coarsely aligned day-night image pairs. Specifically, for the unlabeled day-night image pairs, we use the pixel-level predictions of static object categories on a daytime image as a pseudo supervision to segment its counterpart nighttime image. We further design a re-weighting strategy to handle the inaccuracy caused by misalignment between day-night image pairs and wrong predictions of daytime images, as well as boost the prediction accuracy of small objects. The proposed DANNet is the first one stage adaptation framework for nighttime semantic segmentation, which does not train additional day-night image transfer models as a separate pre-processing stage. Extensive experiments on Dark Zurich and Nighttime Driving datasets show that our method achieves state-of-the-art performance for nighttime semantic segmentation.
연구 동기 및 목표
- 자율주행 응용 분야에서 낮은 조도와 야간 데이터의 부족 문제를 해결한다.
- 사전 학습된 이미지-이미지 번역 모델이 필요 없는 종단 간(end-to-end) 단계별 도메인 적응 프레임워크를 제안하여 별도의 번역 모델을 제거한다.
- 일-야간 이미지 쌍의 근사적 정렬을 활용해 정적 물체 카테고리 예측을 통해 야간 세분화에 대한 의사 supervision을 제공한다.
- 예측 불확실성과 정렬 오차를 다루는 새로운 손실 재가중 전략을 통해 소형 객체의 세분화 정확도를 향상시킨다.
- 합성 데이터나 사전 처리된 이미지 번역에 의존하지 않고도 야간 세분화 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 다른 도메인의 일-야간 이미지 간 강도 분포를 정렬하기 위해 빛 손실(light loss)를 사용하는 가중치 공유 이미지 재조명 네트워크를 훈련한다.
- 소스 도메인으로 Cityscapes 데이터셋(낮 주행 레이블 포함)을 사용하고, 타겟 도메인으로 Dark Zurich-D(낮 주행)와 Dark Zurich-N(야간 주행)을 각각 적용한다.
- 공유된 의미적 세분화 네트워크를 사용해 재조명된 이미지에서 예측을 생성하고, 출력 공간에서의 적대적 훈련을 통해 도메인 간 특징 레이아웃을 정렬한다.
- Dark Zurich-D의 예측 결과를 의사 레이블로 사용하여 Dark Zurich-N에서의 훈련을 수행하며, 노이즈를 줄이기 위해 오직 정적 물체 카테고리에만 집중한다.
- 예측 신뢰도와 공간 분산을 기반으로 손실 가중치를 조정함으로써 불확실한 예측은 낮추고 소형 객체 세분화 성능을 향상시키는 재가중 전략을 도입한다.
- 다중 작업 손실(세분화 손실, 빛 손실, 그리고 적응형 가중치를 가진 전용 정적 물체 손실)을 사용해 전체 네트워크를 종단 간(end-to-end)으로 최적화한다.
실험 결과
연구 질문
- RQ1사전 학습된 이미지 번역 네트워크를 활용하는 이중 단계 방법보다 단일 단계 도메인 적응 프레임워크가 야간 세분화에서 더 뛰어난 성능을 낼 수 있는가?
- RQ2근사적인 일-야간 이미지 쌍에서의 낮 주행 예측 결과를 의사 supervision으로 활용할 경우, 진정한 레이블이 없이도 야간 세분화에 효과적으로 도움이 될 수 있는가?
- RQ3전용 재가중 전략이 저조도 조건에서 소형 객체의 세분화 성능을 향상시키는가?
- RQ4쌍화된 진짜 레이블이 없는 상황에서, 적대적 훈련이 일-야간 도메인 간 특징 분포를 얼마나 효과적으로 정렬하는가?
- RQ5빛 손실 함수를 활용한 이미지 재조명이 도메인 정렬을 향상시키고 세분화 성능을 향상시키는가?
주요 결과
- DANNet은 Dark Zurich-val 데이터셋에서 mIoU 36.76을 기록하여 이전 최신 기술 수준(SOTA) 방법보다 10% 이상 뛰어난 성능을 달성한다.
- Nighttime Driving 테스트 세트에서 PSPNet 백본을 사용한 DANNet은 mIoU 47.70을 기록하여 2위를 차지하며 대부분의 기존 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 제거 실험(ablation study) 결과, Dark Zurich-D에서의 의사 supervision을 제거하면 mIoU가 13.78% 감소함을 확인하여 이 요소가 도메인 적응에서 핵심적인 역할을 한다는 것을 입증한다.
- 재가중 전략은 소형 객체 세분화 성능을 향상시키며, 그 효과는 그림 6에서 명백히 확인되는데, 이전에 놓쳤던 객체들이 정확히 예측됨을 보여준다.
- 재가중 전략에서 표준편차(std)를 0.16로 설정할 경우 최적의 성능을 기록하였으며, 제거 실험 결과 기준 설정 대비 1.8%의 mIoU 향상을 보였다.
- 전체 DANNet 모델은 Dark Zurich-val에서 기준 모델인 AdaptSegNet 대비 10%의 성능 향상을 기록하여 통합된 구성 요소들의 효과를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.