[논문 리뷰] Learning Debiased and Disentangled Representations for Semantic Segmentation
이 논문은 Grad-CAM를 사용하여 훈련 중에 클래스별 특징을 무작위로 억제함으로써 특징의 얽힘과 데이터셋 편향을 줄이는 모델에 종속되지 않는 훈련 기법인 DropClass를 제안한다. 이 방법은 추가 데이터나 애너테이션 없이도 다양한 벤치마크와 아키텍처에서 성능을 향상시키며, 특히 저표본 클래스에서 두드러진 성능 향상을 보인다.
Deep neural networks are susceptible to learn biased models with entangled feature representations, which may lead to subpar performances on various downstream tasks. This is particularly true for under-represented classes, where a lack of diversity in the data exacerbates the tendency. This limitation has been addressed mostly in classification tasks, but there is little study on additional challenges that may appear in more complex dense prediction problems including semantic segmentation. To this end, we propose a model-agnostic and stochastic training scheme for semantic segmentation, which facilitates the learning of debiased and disentangled representations. For each class, we first extract class-specific information from the highly entangled feature map. Then, information related to a randomly sampled class is suppressed by a feature selection process in the feature space. By randomly eliminating certain class information in each training iteration, we effectively reduce feature dependencies among classes, and the model is able to learn more debiased and disentangled feature representations. Models trained with our approach demonstrate strong results on multiple semantic segmentation benchmarks, with especially notable performance gains on under-represented classes.
연구 동기 및 목표
- 분류 작업에 비해 다소 간과된 특징의 얽힘과 데이터셋 편향 문제를 해결하기 위해.
- 동시 발생하는 객체 패턴과 클래스 불균형으로 인한 상위 클래스 간 종속성을 줄이기 위한 훈련 기법을 개발하기 위해.
- 추가 데이터나 애너테이션 없이 기존 아키텍처에 모델에 종속되지 않게 통합 가능하도록 하기 위해.
- 분리된, 편향 제거된 특징 학습을 통해 저표본 클래스에서의 성능 향상시키기 위해.
- 다양한 아키텍처와 벤치마크 데이터셋에서 방법의 유효성을 검증하기 위해.
제안 방법
- 각 입력 이미지에 대해 Grad-CAM를 사용하여 클래스별 특징 맵을 추출하여 각 클래스의 판별적 영역을 식별한다.
- 각 훈련 반복에서, 무작위로 선택된 클래스의 특징 맵을 특징 공간에서 억제하여 상위 클래스 간 종속성을 줄인다.
- 남은 특징 맵을 융합하여 모델 예측을 생성하며, 이는 클래스 표현에 특화된 확률적 드롭아웃의 한 형태로 시뮬레이션된다.
- 모델이 특정 클래스의 특징에 의존도를 낮추도록 유도하기 위해 억제 손실을 도입하여 분리된 표현을 장려한다.
- 모델에 종속되지 않은 훈련 기법으로, 아키텍처 수정 없이도 어떤 세그멘테이션 아키텍처와도 호환된다.
- 표준 크로스 엔트로피 손실과 함께 제안된 새로운 억제 손실을 사용하여 훈련의 안정성과 일반화 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1클래스별 특징의 무작위 억제가 세그멘테이션에서 특징의 분리도와 편향 감소에 어떤 영향을 미치는가?
- RQ2추가 데이터 없이도 모델에 종속되지 않는 훈련 기법이 저표본 클래스에서 성능 향상에 효과적으로 기여할 수 있는가?
- RQ3제안된 억제 손실이 상위 클래스 간 특징 얽힘 감소에 표준 크로스 엔트로피 손실보다 어떻게 뛰어나게 되는가?
- RQ4DropClass는 다양한 아키텍처와 데이터셋에서 일반화 성능을 얼마나 향상시키는가?
- RQ5무작위로 샘플된 클래스의 특징을 억제함으로써 다수 예측 작업에서 더 견고하고 편향이 적은 표현이 도출되는가?
주요 결과
- DropClass는 저표본 클래스에서 뚜렷한 성능 향상을 보이며, Cityscapes에서 최대 2.1%의 mIoU 향상과 PASCAL-Context에서 1.8% 향상을 기록했다.
- 기준 모델 대비 Cityscapes에서 0.7%p, PASCAL-Context에서 0.5%p의 mIoU 향상을 기록했다.
- 제거 실험을 통해 억제 손실이 필수적임을 확인했으며, 이를 제거하면 성능 저하가 발생했다.
- Grad-CAM 맵의 시각화 및 분석 결과, DropClass로 훈련된 모델은 특징의 얽힘 정도가 감소한 것으로 확인되었다.
- DeepLabV3와 HRNet를 포함한 다양한 아키텍처에서 효과를 보이며 광범위한 호환성을 입증했다.
- 억제 손실 없이 무작위 클래스 드롭만 적용한 표준 훈련 대비 DropClass가 성능에서 뛰어나, 제안된 손실 구성 요소의 필수성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.