[논문 리뷰] The Devil is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask Representation
이 논문은 점 레이블을 사용하여 가짜 마스크 품질을 향상시키고 제안 영역에서 잡음(오진 탐지 및 누락)을 줄이는 약한 준지도 학습 인스턴스 세그멘테이션 프레임워크를 제안한다. 점 레이블을 활용해 적응형 피라미드 레벨 선택을 수행하고, 이미지, 원시 마스크, 점 입력을 융합하는 MaskRefineNet을 도입함으로써, 전체로 레이블이 지정된 데이터의 50%만을 사용해 COCO에서 38.8%의 AP를 달성하였으며, 이는 완전 준지도 학습 성능(39.7%)에 거의 근접한다.
In this paper, we introduce a novel learning scheme named weakly semi-supervised instance segmentation (WSSIS) with point labels for budget-efficient and high-performance instance segmentation. Namely, we consider a dataset setting consisting of a few fully-labeled images and a lot of point-labeled images. Motivated by the main challenge of semi-supervised approaches mainly derives from the trade-off between false-negative and false-positive instance proposals, we propose a method for WSSIS that can effectively leverage the budget-friendly point labels as a powerful weak supervision source to resolve the challenge. Furthermore, to deal with the hard case where the amount of fully-labeled data is extremely limited, we propose a MaskRefineNet that refines noise in rough masks. We conduct extensive experiments on COCO and BDD100K datasets, and the proposed method achieves promising results comparable to those of the fully-supervised model, even with 50% of the fully labeled COCO data (38.8% vs. 39.7%). Moreover, when using as little as 5% of fully labeled COCO data, our method shows significantly superior performance over the state-of-the-art semi-supervised learning method (33.7% vs. 24.9%). The code is available at https://github.com/clovaai/PointWSSIS.
연구 동기 및 목표
- 제안 영역에서의 오진 탐지 및 누락을 줄여 준지도 학습 인스턴스 세그멘테이션의 성능 격차를 해소한다.
- 저비용 점 레이블을 약한 지도 신호로 활용해 제안 영역 필터링 및 마스크 정밀화를 이끈다.
- 충분한 지도 신호가 부족한 저자료 환경에서 마스크 예측이 노이즈가 많아지는 문제를 해결한다.
- 최소한의 완전 레이블 데이터와 풍부한 점 레이블 데이터를 활용해 제안 영역 품질과 마스크 정확도를 효과적으로 균형 잡는 방법을 개발한다.
- 점 지도 신호와 정밀화된 마스크 예측을 조합함으로써 현실적인 예산 제약 조건 하에서도 고성능 인스턴스 세그멘테이션을 가능하게 한다.
제안 방법
- 점 레이블을 사용해 인스턴스 제안 영역을 필터링하여 오진 제안 영역을 제거하고 참 양성 제안 영역만 유지함으로써 오진을 줄인다.
- 모든 점을 네트워크 신뢰도 점수 기반으로 가장 신뢰도가 높은 FPN 특징 레벨에 할당하는 적응형 피라미드 레벨 선택을 구현한다.
- 이미지, 원시 마스크, 점을 입력으로 받아 주의 기반 융합을 사용해 노이즈가 많은 마스크 예측을 정밀화하는 MaskRefineNet을 설계한다.
- 완전 레이블이 지정된 데이터로 기반 네트워크를 훈련한 후, 필터링된 제안 영역과 정밀화된 마스크를 사용해 타겟 네트워크를 훈련한다.
- 이중 단계 훈련 파이프라인을 적용한다: 먼저 기반 모델을 완전 레이블 데이터로 훈련하고, 그 다음 점 유도 가짜 레이블을 사용해 타겟 모델을 훈련한다.
- 예측 마스크에서 최소-최대 점 추출을 통해 바운딩 박스를 생성하고, 객체 검출 벤치마크에서 평가한다.
실험 결과
연구 질문
- RQ1약한 준지도 학습 인스턴스 세그멘테이션에서 점 레이블이 오진 제안 영역과 오진 부재 제안 영역을 효과적으로 줄일 수 있는가?
- RQ2완전 레이블이 지정된 데이터가 부족한 상황에서 점 레이블을 어떻게 활용해 마스크 품질을 향상시킬 수 있는가?
- RQ3신뢰도 기반으로 FPN 레벨을 적응적으로 선택하면 마스크 예측 정확도가 향상되는가?
- RQ4이미지, 원시 마스크, 점 입력을 융합하는 MaskRefineNet이 가짜 마스크의 노이즈를 어느 정도 감소시킬 수 있는가?
- RQ5제안된 방법이 훨씬 적은 완전 레이블 데이터로 완전 준지도 학습 성능에 근접한 성능을 달성할 수 있는가?
주요 결과
- 제안된 방법은 완전 레이블이 지정된 데이터의 50%만을 사용해 COCO에서 38.8%의 AP를 달성하였으며, 이는 완전 준지도 학습의 39.7%에 거의 근접한다.
- 완전 레이블이 지정된 데이터의 5%만을 사용할 경우, 33.7%의 AP를 기록하여 기존 최고 수준의 준지도 학습 방법(24.9% AP)을 크게 앞서나간다.
- COCO test-dev 객체 검출 벤치마크에서, 동일한 ResNet-50 백본을 사용한 기존의 약한 준지도 학습 객체 검출 방법들을 뛰어넘는 성능을 보였다.
- 정성적 결과에서는 MaskRefineNet이 모든 세 가지 입력(이미지, 원시 마스크, 점)을 사용했을 때 겹치는 인스턴스를 효과적으로 분리하고 노이즈 픽셀을 제거하는 데 성공했다.
- BDD100K에서 점 레이블 데이터로 훈련된 모델은 점 지도 신호가 없는 모델 대비 작은, 큰, 가림을 겪는 객체에 대해 더 뛰어난 강건성을 보였다.
- 제거 실험 결과, MaskRefineNet의 세 가지 입력 모두 필수적임을 확인했다: 점 또는 원시 마스크를 생략할 경우 오분류 및 정확하지 않은 마스크 경계가 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.