Skip to main content
QUICK REVIEW

[논문 리뷰] DCAN: Dual Channel-wise Alignment Networks for Unsupervised Scene Adaptation

Zuxuan Wu, Xintong Han|arXiv (Cornell University)|2018. 04. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 58인용 수 22
한 줄 요약

DCAN은 화소 수준의 이미지 생성기에서 타겟 도메인 유사 이미지를 합성하고, 분할 네트워크에서 고수준 특징을 정밀하게 보정함으로써 이중 채널별 특징 정렬을 수행하는 경량이며 종단 간 프레임워크를 제안한다. 이는 적대적 훈련 없이도 Synthia-to-Cityscapes 적응에서 최신 기술을 초월하여 최대 1.4% mIoU 향상을 달성한다.

ABSTRACT

Harvesting dense pixel-level annotations to train deep neural networks for semantic segmentation is extremely expensive and unwieldy at scale. While learning from synthetic data where labels are readily available sounds promising, performance degrades significantly when testing on novel realistic data due to domain discrepancies. We present Dual Channel-wise Alignment Networks (DCAN), a simple yet effective approach to reduce domain shift at both pixel-level and feature-level. Exploring statistics in each channel of CNN feature maps, our framework performs channel-wise feature alignment, which preserves spatial structures and semantic information, in both an image generator and a segmentation network. In particular, given an image from the source domain and unlabeled samples from the target domain, the generator synthesizes new images on-the-fly to resemble samples from the target domain in appearance and the segmentation network further refines high-level features before predicting semantic maps, both of which leverage feature statistics of sampled images from the target domain. Unlike much recent and concurrent work relying on adversarial training, our framework is lightweight and easy to train. Extensive experiments on adapting models trained on synthetic segmentation benchmarks to real urban scenes demonstrate the effectiveness of the proposed framework.

연구 동기 및 목표

  • 합성 도메인에서 실세계 도시 환경으로 모델을 이동할 때 발생하는 도메인 이동 문제를 해결하기 위해.
  • 적대적 훈련에 의존하지 않고도 화소 수준과 특징 수준의 도메인 차이를 줄이기 위해.
  • 채널별 정규화를 통해 도메인 적응 중 공간적 구조와 의미 정보를 유지하기 위해.
  • 타겟 도메인 이미지의 확률적 샘플링을 활용하여 일반화 능력과 훈련 효율성을 향상시키기 위해.

제안 방법

  • 프레임워크는 소스 및 타겟 도메인 특징 맵의 채널별 통계를 정렬하기 위해 인스턴스 정규화를 사용한다.
  • 이미지 생성기는 임의로 샘플된 타겟 도메인 이미지 스타일에 맞게 소스 이미지를 합성함으로써 화소 수준의 도메인 정렬을 가능하게 한다.
  • 분할 네트워크는 타겟 도메인 통계를 사용하여 고수준 특징을 정교화하기 위해 채널별 특징 정렬을 적용한다.
  • 타겟 이미지의 확률적 샘플링은 정규화와 계산 효율성을 제공하며, 전체 목록을 순회하는 것을 방지한다.
  • 전체 시스템은 적대적 손실 없이 종단 간으로 훈련되며, 이는 경량화되고 최적화가 용이하다.
  • 특징 정렬은 분할 네트워크의 다중 레이어에 적용되며, 최적의 성능은 Conv3 레이어 이후에 달성된다.

실험 결과

연구 질문

  • RQ1채널별 특징 정렬이 의미 분할의 화소 공간과 특징 공간에서 도메인 이동을 효과적으로 줄일 수 있는가?
  • RQ2성능 및 훈련 효율성 측면에서 타겟 도메인 이미지의 전체 열거 대비 확률적 샘플링은 어떻게 비교되는가?
  • RQ3채널별 정렬은 글로벌 특징 정렬 방법에 비해 공간적 구조와 의미 정보를 더 잘 유지하는가?
  • RQ4비적대적 프레임워크가 비지도 장면 적응에서 최신 기술의 적대적 방법을 능가할 수 있는가?
  • RQ5네트워크 내에서 채널별 정렬이 의미 분할 성능 향상에 가장 효과적인 위치는 어디인가?

주요 결과

  • DCAN은 Synthia-to-Cityscapes 벤치마크에서 평균 교차율(mIoU) 35.4%를 달성하여 기준 방법보다 1.4% 높은 성능을 보였다.
  • 적대적 기반 방법인 ADDA(34.0% mIoU)보다 빠른 수렴 속도를 보이며, 적대적 훈련이 필요 없어도 성능이 뛰어나다.
  • 소스 이미지당 1~8장의 타겟 이미지를 확률적으로 샘플링하는 것이 3,000장의 전체 타겟 이미지를 사용하는 것보다 더 높은 성능을 내어, 정규화 효과를 입증한다.
  • FCN8s-VGG16에서 최적의 정렬은 Conv3 레이어 이후에 이루어지며, 이는 충분한 공간 해상도와 채널 용량을 확보하기 때문이다.
  • PSPNet 및 FCN8s-ResNet101에서는 단 한 장의 샘플된 타겟 이미지만으로도 경쟁 가능한 성능을 달성하여 자료 부족 조건에서도 높은 효율성을 보였다.
  • MMD 및 CORAL과 같은 특징 정렬 방법은 소스 전용 기준보다 성능이 열 劣하므로, 채널별 정규화의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.