[논문 리뷰] Towards Single Stage Weakly Supervised Semantic Segmentation
이 논문은 사전 학습된 백본이나 다단계 정련이 필요 없이, 단일 단계에서 점(annotation)만을 사용하여 신뢰할 수 있는 허위 마스크(pseudo-masks)를 생성하는 약한 감독 세분화 방법을 제안한다. 반복적인 산산이 흩어짐과 무작위 보행을 통한 점 블롯(point blots)을 도입하고, 공간적으로 정확한 특징 정련을 위해 확장 거리 필드(expanding distance fields)를 활용함으로써, 벤치마크(Pascal VOC 2012) 및 실세계 데이터셋(CRAID, CityPersons, IAD)에서 최신 기술(SOTA) 성능을 달성한다. 기존의 SOTA 방법보다도 유의미한 성능 향상을 보였다.
The costly process of obtaining semantic segmentation labels has driven research towards weakly supervised semantic segmentation (WSSS) methods, using only image-level, point, or box labels. The lack of dense scene representation requires methods to increase complexity to obtain additional semantic information about the scene, often done through multiple stages of training and refinement. Current state-of-the-art (SOTA) models leverage image-level labels to produce class activation maps (CAMs) which go through multiple stages of refinement before they are thresholded to make pseudo-masks for supervision. The multi-stage approach is computationally expensive, and dependency on image-level labels for CAMs generation lacks generalizability to more complex scenes. In contrary, our method offers a single-stage approach generalizable to arbitrary dataset, that is trainable from scratch, without any dependency on pre-trained backbones, classification, or separate refinement tasks. We utilize point annotations to generate reliable, on-the-fly pseudo-masks through refined and filtered features. While our method requires point annotations that are only slightly more expensive than image-level annotations, we are to demonstrate SOTA performance on benchmark datasets (PascalVOC 2012), as well as significantly outperform other SOTA WSSS methods on recent real-world datasets (CRAID, CityPersons, IAD).
연구 동기 및 목표
- 비용이 많이 드는 학습 파이프라인과 사전 학습된 백본에 의존하는 다단계 약한 감독 세분화 방법의 한계를 해결하기 위해.
- 이미지 수준의 레이블에 의존도를 줄이기 위해, 이는 노이즈가 많은 클래스 활성화 지도를 유도하고, 작은 객체나 수많은 객체가 있는 복잡한 시나리오에서 실패하기 때문이다.
- 사전 학습된 모델이 존재하지 않거나 효과적이지 않은 비벤치마크 실세계 데이터셋에서 효과적인 세분화를 가능하게 하기 위해.
- 사전 학습된 백본에 의존하지 않고, 이미지 수준의 레이블보다 略로 더 비용이 드는 점(annotation)만을 사용하여도 훈련이 가능한 일반화 가능한 방법을 개발하기 위해.
제안 방법
- 점 생성기(point generator) 컴포넌트는 반복적인 애핀 변형과 무작위 보행을 통해 흩어진 사용자 정의 점들을 점 블롯으로 변환함으로써, 조밀하고 신뢰할 수 있는 허위 마스크를 생성한다.
- 점 블롯은 특징 학습을 안내하는 공간적 감독 신호로 사용되며, 이미지 수준의 레이블이나 사전 학습된 분류기의 필요성을 대체한다.
- 확장 거리 필드는 특징 신뢰도를 이미지 전반에 걸쳐 전파함으로써 공간 정렬을 향상시키기 위해 도입되었으며, 허위 마스크의 품질을 향상시킨다.
- 이 방법은 점 블롯과의 거리에 기반해 특징을 정련하는 PAC Refiner 모듈을 활용하여, 세분화 정확도를 향상시킨다.
- 모든 구성 요소는 별도의 사전 학습 또는 정련 단계 없이 단일 단계에서 훈련되며, 종래의 학습에서부터 엔드 투 엔드 훈련이 가능하다.
- 이 방법은 사전 학습된 백본에 의존하지 않고 점 기반 공간 가이던스에 기반함으로써, 임의의 데이터셋에 적용 가능하다.
실험 결과
연구 질문
- RQ1사전 학습된 백본이나 다단계 정련에 의존하지 않고도 단일 단계 약한 감독 세분화 방법이 최신 기술 성능을 달성할 수 있는가?
- RQ2복잡한 실세계 시나리오에서 정확한 허위 마스크 생성을 위해 점(annotation)이 이미지 수준의 레이블보다 얼마나 우수한가?
- RQ3기본적인 CAM 기반 방법과 비교했을 때, 확장 거리 필드와 점 블롯은 정렬 및 세분화 성능 향상에 얼마나 기여하는가?
- RQ4사전 학습된 모델이 실패하거나 존재하지 않는 데이터셋에 대해, 오직 점(annotation)만을 사용해 훈련된 방법이 효과적으로 일반화될 수 있는가?
- RQ5이미지 수준의 레이블 기반 방법이 어려움을 겪는 고객체 수와 작은 객체 크기를 가진 데이터셋에서 이 방법은 어떻게 성능을 내는가?
주요 결과
- Pascal VOC 2012에서 제안된 방법은 테스트 세트에서 72.1% mIoU를 달성하였으며, 사전 학습된 백본을 사용하지 않아도 SOTA 단일 단계 방법 [7]보다 0.3% 높은 성능을 보였다.
- CRAID 데이터셋에서 방법은 72.1% mIoU를 달성하였으며, 동일한 평가 프로토콜 하에서 SOTA 베이스라인 [7]이 기록한 54.9%에 비해 유의미하게 높은 성능을 보였다.
- CityPersons에서 방법은 62.8% mIoU를 기록하였으며, SOTA 베이스라인 [7]을 14.6% 포인트 이상 앞서며, 소형 객체가 많은 시나리오에 대한 강력한 일반화 능력을 입증했다.
- IAD에서 방법은 72.4% mIoU를 달성하였으며, 다시 한번 [7]을 14.8% 포인트 이상 앞섰다. 이는 복잡한 실세계 환경에서의 효과성을 확인한다.
- 절단 실험 결과, 확장 거리 필드, 점 블롯, PAC Refiner를 모두 조합할 경우 60.7% mIoU를 기록하였으며, 최적 성능을 내기 위해 모든 구성 요소가 필수적임을 확인했다.
- 이 방법은 모든 벤치마크 및 실세계 데이터셋에서 최신 기술 성능을 달성하면서도, 사전 학습된 모델에 대한 의존도를 제거하고 종래의 학습에서부터 훈련 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.