Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Dataset Collaborative Learning for Semantic Segmentation.

Li Wang, Dong Li|arXiv (Cornell University)|2021. 03. 21.
Advanced Neural Network Applications참고 문헌 24인용 수 5
한 줄 요약

이 논문은 다수의 데이터셋을 사용하여 훈련하는 Cross-Dataset Collaborative Learning (CDCL)를 제안한다. 이 방법은 Dataset-Aware Blocks (DABs)와 Dataset Alternation Training (DAT)를 활용하여 의미 분할의 일반화 성능을 향상시킨다. 추가 FLOPs 없이도 상태의 기술을 달성하며, 단일 데이터셋 기반 모델 대비 Cityscapes, BDD100K, CamVid에서 각각 5.65%, 6.57%, 5.79%의 mIoU 향상을 이룬다.

ABSTRACT

Recent work attempts to improve semantic segmentation performance by exploring well-designed architectures on a target dataset. However, it remains challenging to build a unified system that simultaneously learns from various datasets due to the inherent distribution shift across different datasets. In this paper, we present a simple, flexible, and general method for semantic segmentation, termed Cross-Dataset Collaborative Learning (CDCL). Given multiple labeled datasets, we aim to improve the generalization and discrimination of feature representations on each dataset. Specifically, we first introduce a family of Dataset-Aware Blocks (DAB) as the fundamental computing units of the network, which help capture homogeneous representations and heterogeneous statistics across different datasets. Second, we propose a Dataset Alternation Training (DAT) mechanism to efficiently facilitate the optimization procedure. We conduct extensive evaluations on four diverse datasets, i.e., Cityscapes, BDD100K, CamVid, and COCO Stuff, with single-dataset and cross-dataset settings. Experimental results demonstrate our method consistently achieves notable improvements over prior single-dataset and cross-dataset training methods without introducing extra FLOPs. Particularly, with the same architecture of PSPNet (ResNet-18), our method outperforms the single-dataset baseline by 5.65\%, 6.57\%, and 5.79\% of mIoU on the validation sets of Cityscapes, BDD100K, CamVid, respectively. Code and models will be released.

연구 동기 및 목표

  • 다양한 의미 분할 데이터셋 간의 분포 이탈 문제를 해결하기 위해.
  • 다양한 데이터셋 간의 특징 표현 일반화 및 구별 능력을 향상시키기 위해.
  • 계산 비용 증가 없이도 여러 레이블이 부여된 데이터셋을 효과적으로 활용할 수 있는 융통성 있고 통합된 훈련 프레임워크를 개발하기 위해.
  • 아키텍처 수정 없이도 다양한 데이터셋에서 일관된 성능 향상을 달성하기 위해.

제안 방법

  • 모든 데이터셋 간의 동일성 및 이질성 통계를 포착할 수 있는 학습 가능한 단위인 Dataset-Aware Blocks (DABs)를 도입한다.
  • 최적화 과정에서 데이터셋 간을 번갈아가며 훈련하는 Dataset Alternation Training (DAT) 전략을 설계하여 수렴성과 특징 다양성을 향상시킨다.
  • DABs를 다수의 스테이지에 삽입한 공통 백본 네트워크(예: ResNet-18 기반의 PSPNet)를 사용하여 데이터셋 특성에 적응한다.
  • 각 훈련 단계에서 다른 데이터셋에서 샘플링하는 다중 데이터셋 훈련 스케줄을 활용하여 교차 데이터셋 지식 전이를 가능하게 한다.
  • 추가 FLOPs 없이도 추론 효율성을 유지한다. 이는 단지 파rameter 효율적인 DAB 모듈을 추가하기 때문이다.
  • 추가 정규화나 보조 헤드 없이 표준 의미 분할 손실을 사용해 모델을 종합적으로 최적화한다.

실험 결과

연구 질문

  • RQ1단일 데이터셋 훈련 대비 다수의 데이터셋에서 훈련된 통합 모델이 의미 분할의 일반화 성능을 향상시킬 수 있는가?
  • RQ2상당한 도메인 이탈이 존재하는 데이터셋에서 효과적으로 학습하면서도 효율성을 유지할 수 있는가?
  • RQ3추가 FLOPs 없이도 효과적인 교차 데이터셋 지식 전이를 가능하게 하는 아키텍처 구성 요소는 무엇인가?
  • RQ4훈련 중 데이터셋을 번갈아가며 교체하는 것이 특징의 구별 능력과 일반화 성능 향상에 기여하는가?
  • RQ5제안된 방법이 다양한 벤치마크에서 기존의 단일 및 다중 데이터셋 훈련 접근법을 초월할 수 있는가?

주요 결과

  • CDCL은 단일 데이터셋 기반의 PSPNet(ResNet-18) 대비 Cityscapes에서 mIoU를 5.65% 향상시켰다.
  • BDD100K에서는 6.57%의 mIoU 향상을 기록하여 다양한 도시 주행 환경에서도 강력한 일반화 능력을 입증했다.
  • CamVid에서는 5.79%의 mIoU 향상을 달성하여 해상도 및 애너테이션 품질이 상이한 데이터셋 간에서도 뛰어난 견고성을 입증했다.
  • Cityscapes, BDD100K, CamVid, COCO Stuff의 네 가지 평가된 데이터셋 전반에서 성능 향상이 일관되게 관찰되었다.
  • 추가 FLOPs 없이도 이러한 성능 향상을 달성하여 추론 효율성을 유지했다.
  • 제거 실험 결과 DABs와 DAT 모두 성능 향상에 필수적임을 확인했으며, 둘 중 하나를 제거하면 mIoU가 크게 감소했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.