[논문 리뷰] WEDGE: Web-Image Assisted Domain Generalization for Semantic Segmentation
WEDGE는 합성 훈련 이미지에 웹에서 크롤링한 이미지의 스타일을 실시간으로 주입하고, 두 단계 훈련 과정에서 의사 레이블이 부여된 웹 이미지를 활용함으로써, 훈련 중에 접근할 수 없는 도메인에 대해 일반화 성능을 향상시키는 웹-이미지 기반 도메인 일반화 프레임워크를 제안한다. 다양한 애플리케이션 관련 웹 크롤링 이미지를 활용함으로써, 실제 도메인에서의 모델 일반화 능력을 향상시키며, 여러 실세계 테스트 도메인에서 평균 5.5% 향상된 최신 기술 수준의 성능을 달성한다.
Domain generalization for semantic segmentation is highly demanded in real applications, where a trained model is expected to work well in previously unseen domains. One challenge lies in the lack of data which could cover the diverse distributions of the possible unseen domains for training. In this paper, we propose a WEb-image assisted Domain GEneralization (WEDGE) scheme, which is the first to exploit the diversity of web-crawled images for generalizable semantic segmentation. To explore and exploit the real-world data distributions, we collect web-crawled images which present large diversity in terms of weather conditions, sites, lighting, camera styles, etc. We also present a method which injects styles of the web-crawled images into training images on-the-fly during training, which enables the network to experience images of diverse styles with reliable labels for effective training. Moreover, we use the web-crawled images with their predicted pseudo labels for training to further enhance the capability of the network. Extensive experiments demonstrate that our method clearly outperforms existing domain generalization techniques.
연구 동기 및 목표
- 훈련 중에 데이터에 접근할 수 없는 새로운 실세계 도메인으로의 일반화가 필요한 세분화 분석에서 도메인 일반화 문제를 해결하는 것.
- 기존 도메인 일반화 방법들이 제한된 스타일 소스(예: ImageNet)에 의존하는 데서 비롯되는 한계를 극복하는 것. 이는 종종 타겟 애플리케이션과 관련성이 없는 경우가 많다.
- 실세계 웹 크롤링 이미지의 다양성을 활용하여 날씨, 조명, 카메라 스타일, 지리적 위치 등 다양한 요소를 포함함으로써 더 효과적이고 현실적인 도메인 일반화를 달성하는 것.
- 이미지 간 변환을 필요로 하지 않고도 대규모 웹 이미지 컬렉션을 효율적으로 활용할 수 있도록 실시간으로 특징 맵에 스타일을 주입하는 효율적인 기법을 개발하는 것.
- 두 단계 훈련 파이프라인을 통해 예측된 의사 레이블이 부여된 웹 크롤링 이미지를 활용하여 모델의 일반화 능력을 향상시키는 것.
제안 방법
- 목표 도메인과 관련성이 있도록 애플리케이션 전용 키워드(예: '드라이빙 + 도로')를 사용하여 웹 크롤링 이미지를 수집한다.
- 훈련 중 실시간으로 웹 이미지의 특징 수준 스타일을 합성 훈련 이미지에 전달하기 위해 스타일 주입 모듈을 사용한다. 이는 ResNet의 경우 첫 번째 및 두 번째 잔차 블록, VGG의 경우 두 번째 및 세 번째 잔차 블록의 특징 통계를 기반으로 한다.
- 훈련 과정은 두 단계로 나뉜다: 제1단계에서는 스타일 주입을 통해 합성 이미지를 사용하여 모델을 훈련한다. 제2단계에서는 의사 레이블이 부여된 웹 크롤링 이미지를 추가 훈련 데이터로 통합한다.
- 웹 크롤링 이미지의 의사 레이블은 제1단계에서 훈련된 모델을 사용하여 생성되며, 레이블 신뢰도를 제어하기 위해 임계값 하이퍼파rameter τ를 사용한다.
- 이미지 간 변환을 피하기 위해 직접 특징 맵에서 작업함으로써 대규모 웹 이미지 컬렉션을 효율적으로 활용할 수 있도록 한다.
- 절단 분석 결과, 더 깊은 레이어(예: 네 번째 잔차 블록)에 스타일을 주입할 경우 성능 저하가 발생함을 확인하여, 스타일 전달에 앞선 특징 맵을 사용하는 것이 타당함을 입증한다.

실험 결과
연구 질문
- RQ1합성 데이터 외에 다양한 실세계 특성을 지닌 웹 크롤링 이미지를 활용할 경우, 세분화 분석에서 도메인 일반화 성능이 향상되는가?
- RQ2웹 이미지에서 실시간 특징 수준의 스타일 주입 방식이 이미지 간 변환 또는 무작위 스타일 증강 방식보다 더 나은 일반화 성능을 내는가?
- RQ3의사 레이블이 부여된 웹 이미지가 의미론적으로 관련성이 없더라도, 두 단계 훈련 전략을 통해 모델의 강건성을 효과적으로 향상시킬 수 있는가?
- RQ4웹 이미지 키워드 선택(예: '드라이빙 + dense fog' 대비 '드라이빙 + road')이 모델의 도메인 일반화 성능에 어떤 영향을 미치는가?
- RQ5스태일 주입에 가장 적합한 특징 레이어 조합은 무엇인가? 이는 의미 일致성을 유지하면서 도메인 일반화 능력을 향상시키는 데 기여하는가?
주요 결과
- WEDGE는 세 가지 실세계 테스트 데이터셋(Cityscapes, BDD100K, Mapillary)에서 최신 기술 수준의 성능을 달성하였으며, ResNet101 기반으로 GTA5에서 훈련한 경우 Cityscapes 테스트 세트에서 평균 mIoU가 47.30%를 기록했다.
- 기존 도메인 일반화 기법 대비 평균 mIoU 향상 폭이 최대 5.5%에 이르며, 이는 교차 도메인 일반화 능력 향상에 있어 뚜렷한 성과를 보임을 입증한다.
- 일반 키워드 '드라이빙 + 도로'를 사용해 웹 이미지를 검색할 경우 도메인 특화 키워드인 '드라이빙 + dense fog'를 사용한 경우보다 성능이 뛰어나며, 평균 mIoU는 각각 43.73%와 43.39%를 기록했다.
- 의사 레이블링을 포함한 두 단계 훈련 전략은 제1단계만 수행한 경우 대비 성능을 2.5–3.5% 향상시켰으며, 추가 웹 이미지 데이터의 효과를 확인한다.
- 절단 분석 결과, 더 깊은 레이어(예: 네 번째 잔차 블록)에 스타일을 주입할 경우 성능 저하가 발생함을 확인하여, 스타일 전달에 앞선 특징 맵이 더 적합함을 입증한다.
- τ = 0.05로 의사 레이블을 임계화할 경우 레이블 품질과 훈련 안정성의 최적 균형을 확보하며, 낮은 임계값(예: τ = 0.01)을 사용할 경우 성능 저하가 발생함을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.