[논문 리뷰] Weakly-supervised Instance Segmentation via Class-agnostic Learning with Salient Images
이 논문은 유사도 기반 객체 검출을 보조 메모리로 활용하여 구bounding 박스에 기반한 분할 성능을 향상시키는 약한 감독형 인스턴스 세분화 방법인 BoxCaseg를 제안한다. 7,991장의 유사도 이미지와 상자 레이블이 붙은 이미지에서 동시에 학습하고, 병합 및 제거 전략을 통해 예측을 보완함으로써, PASCAL VOC에서 완전 감독형 Mask R-CNN 수준의 성능을 달성하고 COCO에서는 이전 최고 성능을 초월한다. 최소한의 약한 감독만으로도 성능을 내는 데 성공하였다.
Humans have a strong class-agnostic object segmentation ability and can outline boundaries of unknown objects precisely, which motivates us to propose a box-supervised class-agnostic object segmentation (BoxCaseg) based solution for weakly-supervised instance segmentation. The BoxCaseg model is jointly trained using box-supervised images and salient images in a multi-task learning manner. The fine-annotated salient images provide class-agnostic and precise object localization guidance for box-supervised images. The object masks predicted by a pretrained BoxCaseg model are refined via a novel merged and dropped strategy as proxy ground truth to train a Mask R-CNN for weakly-supervised instance segmentation. Only using $7991$ salient images, the weakly-supervised Mask R-CNN is on par with fully-supervised Mask R-CNN on PASCAL VOC and significantly outperforms previous state-of-the-art box-supervised instance segmentation methods on COCO. The source code, pretrained models and datasets are available at \url{https://github.com/hustvl/BoxCaseg}.
연구 동기 및 목표
- 피그먼트 레이블이 아닌 상자 레이블과 유사도 이미지 레이블만을 활용하여 인스턴스 세분화의 annotation 비용을 줄이는 것.
- 학습 중에 유사도 이미지를 보조 메모리로 사용하여 인간과 유사한 클래스 무관 객체 세분화를 모방하는 것.
- 병합 및 제거 전략을 활용한 새로운 프록시 마스크 생성 파이프라인을 통해 약한 감독형 인스턴스 세분화 성능을 향상시키는 것.
- 최소한의 약한 감독으로 PASCAL VOC와 COCO에서 최고 성능을 달성하고 완전 감독형 성능에 가까워지는 것.
제안 방법
- 단일 딥 네트워크 내에서 상자 감독 이미지와 유사도 객체 검출 이미지를 동시에 학습하는 다중 작업 학습 프레임워크.
- 다중 인스턴스 분류에서 픽셀 수준의 세분화로의 가중치 전이를 통해 특징 학습을 향상시키는 모델.
- 사전 학습된 BoxCaseg 모델이 상자 감독 이미지에 대해 고품질의 인스턴스 마스크를 생성하고, 병합 및 제거 전략을 통해 프록시 마스크로 보완한다.
- 프록시 마스크를 사용하여 약한 감독형 인스턴스 세분화를 위한 Mask R-CNN을 재학습시킨다.
- 배치당 상자 감독 이미지와 유사도 이미지의 비율을 고정(예: 9:7)하여 데이터 균형을 유지하고 안정성을 향상시킨다.
- 유사도 세분화 헤드와 전이된 세분화 헤드의 가중치 융합을 적용하였으며, 최적의 성능는 α=0.7에서 달성되었다.

실험 결과
연구 질문
- RQ1유사도 객체 검출 데이터가 오직 상자 레이블만을 사용하는 약한 감독형 인스턴스 세분화에서 효과적인 보조 메모리로 기능할 수 있는가?
- RQ2약한 감독 하에서 Mask R-CNN을 학습하기 위해 프록시 마스크를 효과적으로 생성하고 보완할 수 있는가?
- RQ3공동 학습 중 상자 감독 이미지와 유사도 이미지 간 최적의 균형 비율은 무엇인가?
- RQ4프록시 마스크에 대한 병합 및 제거 전략이 약한 감독 학습에서 허위 레이블의 품질을 크게 향상시키는가?
주요 결과
- 이 방법은 오직 7,991장의 유사도 이미지만을 사용하여 COCO 검증 세트에서 70.9 mIoU를 달성했으며, 이는 이전 최고 성능의 상자 감독 방법을 뛰어넘었다.
- PASCAL VOC에서는 완전 감독형 Mask R-CNN과 동일한 성능을 달성하여, 전이된 세분화 헤드의 가중치 α=0.7일 때 71.8 mIoU를 기록했다.
- 병합 전략은 COCO에서 AP를 0.6, AP75를 0.9 향상시켰고, IoU 임계치 0.95로 제거 전략을 적용한 경우 최고의 성능를 기록했다.
- 배치당 상자 감독 이미지 대비 유사도 이미지 비율이 9:7일 때 최고의 성능가 달성되었으며, 이는 COCO에서 70.9 mIoU의 성능로 이어졌다.
- α=0.7에서의 가중치 전이 메커니즘은 단일 헤드를 사용하는 것보다 1.3% 향상된 성능를 기록하여 강건성과 효과성을 입증했다.
- IoU 임계치 0.95로 제거 전략을 적용한 결과 COCO에서 30.9 AP를 기록했으며, 80%의 마스크가 제거되었는데, 이는 고품질 마스크가 다량의 중간 품질 마스크보다 더 유익하다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.