Skip to main content
QUICK REVIEW

[논문 리뷰] HRDA: Context-Aware High-Resolution Domain-Adaptive Semantic Segmentation

Lukas Hoyer, Dengxin Dai|arXiv (Cornell University)|2022. 04. 27.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

HRDA는 세분화 분할에서 비지도 도메인 적응을 위한 다중 해상도 훈련 프레임워크를 제안하며, 높은 해상도의 세부 사항 코너스토어와 낮은 해상도의 맥락 코너스토어를 학습 가능한 스케일 주의 메커니즘을 통해 조합하여 세밀한 세부 정보를 유지하면서도 장거리 맥락을 포착한다. GPU 메모리 사용을 관리 가능한 수준으로 유지하면서도, GTA→Cityscapes에서 73.8 mIoU, Synthia→Cityscapes에서 65.8 mIoU의 최신 기술 수준(SOTA) 성능을 달성하며 각각 5.5 및 4.9 mIoU 향상.

ABSTRACT

Unsupervised domain adaptation (UDA) aims to adapt a model trained on the source domain (e.g. synthetic data) to the target domain (e.g. real-world data) without requiring further annotations on the target domain. This work focuses on UDA for semantic segmentation as real-world pixel-wise annotations are particularly expensive to acquire. As UDA methods for semantic segmentation are usually GPU memory intensive, most previous methods operate only on downscaled images. We question this design as low-resolution predictions often fail to preserve fine details. The alternative of training with random crops of high-resolution images alleviates this problem but falls short in capturing long-range, domain-robust context information. Therefore, we propose HRDA, a multi-resolution training approach for UDA, that combines the strengths of small high-resolution crops to preserve fine segmentation details and large low-resolution crops to capture long-range context dependencies with a learned scale attention, while maintaining a manageable GPU memory footprint. HRDA enables adapting small objects and preserving fine segmentation details. It significantly improves the state-of-the-art performance by 5.5 mIoU for GTA-to-Cityscapes and 4.9 mIoU for Synthia-to-Cityscapes, resulting in unprecedented 73.8 and 65.8 mIoU, respectively. The implementation is available at https://github.com/lhoyer/HRDA.

연구 동기 및 목표

  • GPU 메모리 사용을 줄이기 위해 이미지를 저해상도로 축소하는 기존 비지도 도메인 적응(UDA) 방법의 한계를 해결하기 위해.
  • 저해상도 예측에서 손실되는 소형 객체 분할 및 세밀한 경계 세부 정보를 유지하기 위해.
  • GPU 메모리 소비를 늘리지 않고 도메인 이동에 강건한 장거리 맥락적 의존성을 포착하기 위해.
  • 학습 가능한 주의 메커니즘을 통해 고해상도 세부 정보 코너스토어와 저해상도 맥락 코너스토어의 강점을 융합하기 위해.
  • 계산 가능성을 유지하면서도 UDA 세분화 분할에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • HRDA는 각 이미지에서 두 개의 코너스토어를 사용하여 훈련한다: 장거리 맥락을 위한 큰 저해상도(LR) 맥락 코너스토어와 세밀한 세부 정보를 위한 작은 고해상도(HR) 세부 정보 코너스토어.
  • 모델은 입력에 따라 신뢰도에 기반해 양쪽 코너스토어의 예측을 동적으로 융합하는 학습 가능한 스케일 주의 모듈을 사용한다.
  • 주의 메커니즘은 추론 중에 각 이미지 영역에서 어느 스케일(LR 또는 HR)이 더 신뢰할 만한지 학습한다.
  • GPU 메모리 효율성을 유지하기 위해 랜덤 코너스토어를 사용하며, HR 세부 정보 코너스토어는 LR 맥락 코너스토어 내의 국소 영역에 집중된다.
  • 추가로, 세부 정보 브랜치에 대해 겹치는 슬라이딩 코너스토어와 세부 정보 브랜치에 대한 작은 보조 손실을 도입하여 특징 학습을 향상시켰다.
  • 이 프레임워크는 기존 UDA 방법과 호환되며, DAFormer과 같은 모델에 통합될 수 있다.

실험 결과

연구 질문

  • RQ1고해상도 세부 정보 코너스토어와 저해상도 맥락 코너스토어를 조합하면 비지도 도메인 적응에서 세분화 분할 성능을 향상시킬 수 있는가?
  • RQ2학습 가능한 스케일 주의 메커니즘이 다양한 해상도에서의 예측을 효과적으로 융합하여 분할 정확도를 향상시키는가?
  • RQ3다중 해상도 훈련은 GPU 메모리 제약 조건 하에서 소형 객체의 세밀한 세부 정보를 유지하면서도 장거리 맥락 인식 능력을 유지할 수 있는가?
  • RQ4HRDA는 단순 고해상도 훈련 또는 단일 스케일 접근 방식에 비해 성능과 메모리 효율성 측면에서 어떻게 비교되는가?
  • RQ5맥락 코너스토어와 세부 정보 코너스토어가 최종 성능 향상에 각각 얼마나 기여하는가?

주요 결과

  • HRDA는 GTA→Cityscapes 벤치마크에서 73.8 mIoU를 달성하여 이전 최신 기술 수준(SOTA)보다 5.5 mIoU 향상.
  • Synthia→Cityscapes 벤치마크에서 HRDA는 65.8 mIoU를 기록하여 이전 SOTA보다 4.9 mIoU 향상.
  • 학습 가능한 스케일 주의 메커니즘이 양 스케일의 예측을 단순 평균 내는 것보다 +3.0 mIoU 기여.
  • 실제 HR 세부 정보 코너스토어를 사용할 경우, LR 코너스토어를 이중 선형 보간으로 HR으로 확대하는 것보다 +1.9 mIoU 향상되며, 진정한 고해상도 특징의 중요성을 입증.
  • HR₀.₇₅ 크기의 큰 HR 코너스토어를 사용하는 강력한 베이스라인보다 40% 적은 GPU 메모리 사용에도 불구하고 +3.8 mIoU 성능 향상.
  • 제거 분석 결과, 겹치는 세부 정보 코너스토어와 세부 정보 브랜치에 대한 추가 감독이 각각 +0.9 mIoU 및 +1.4 mIoU 성능 향상 기여.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.