[논문 리뷰] Box2Mask: Box-supervised Instance Segmentation via Level-set Evolution
Box2Mask는 유일한 경계 상자 감독만을 사용하여 레벨셋 진화를 활용하는 새로운 단단계 인스턴스 세분화 프레임워크를 제안한다. 딥 페처와 국소 일致성 모듈을 이용해 상자 내에서 마스크를 반복적으로 최적화한다. Swin-Transformer large 백본을 사용하여 COCO에서 42.4%의 마스크 AP를 달성하며, 완전한 감독 방법과 동등한 성능을 내고, 경계 상자 감독 기반 인스턴스 세분화 분야에서 새로운 최고 성능을 수립한다.
In contrast to fully supervised methods using pixel-wise mask labels, box-supervised instance segmentation takes advantage of simple box annotations, which has recently attracted increasing research attention. This paper presents a novel single-shot instance segmentation approach, namely Box2Mask, which integrates the classical level-set evolution model into deep neural network learning to achieve accurate mask prediction with only bounding box supervision. Specifically, both the input image and its deep features are employed to evolve the level-set curves implicitly, and a local consistency module based on a pixel affinity kernel is used to mine the local context and spatial relations. Two types of single-stage frameworks, i.e., CNN-based and transformer-based frameworks, are developed to empower the level-set evolution for box-supervised instance segmentation, and each framework consists of three essential components: instance-aware decoder, box-level matching assignment and level-set evolution. By minimizing the level-set energy function, the mask map of each instance can be iteratively optimized within its bounding box annotation. The experimental results on five challenging testbeds, covering general scenes, remote sensing, medical and scene text images, demonstrate the outstanding performance of our proposed Box2Mask approach for box-supervised instance segmentation. In particular, with the Swin-Transformer large backbone, our Box2Mask obtains 42.4% mask AP on COCO, which is on par with the recently developed fully mask-supervised methods. The code is available at: https://github.com/LiWentomng/boxlevelset.
연구 동기 및 목표
- 완전한 감독 기반 인스턴스 세분화의 높은 애너테이션 비용 문제를 해결하기 위해, 경계 상자 애너테이션만으로도 정확한 마스크 예측을 가능하게 하기 위해.
- 단순한 쌍별 유사도 모델링을 물리적으로 타당한 레벨셋 진화 프레임워크로 대체하여, 경계 상자 감독 기반 인스턴스 세분화의 강인성과 경계 정확도를 향상시키기 위해.
- 전통적인 레벨셋 모델을 딥 네트워크에 통합하여, 경계 상자 감독 하에 엔드 투 엔드로 미분 가능한 마스크 최적화를 가능하게 하기 위해.
- 단일 단계 아키텍처로서 CNN 기반 및 트랜스포머 기반 모델을 모두 개발하여, 국소 일치성과 상자 수준 매칭을 통한 반복적 레벨셋 진화를 지원하기 위해.
- 경계 상자 감독 기반과 완전한 마스크 감독 기반 인스턴스 세분화 방법 간의 성능 격차를 줄이기 위해.
제안 방법
- 방법은 유일한 경계 상자 감독만을 사용하여, 마스크 예측을 반복적으로 최적화한다. Swin-Transformer large 백본을 사용하여 COCO에서 42.4%의 마스크 AP를 달성하며, 완전한 감독 기반 방법과 동등한 성능을 내고, 경계 상자 감독 기반 인스턴스 세분화 분야에서 새로운 최고 성능을 수립한다.
- 방법은 전통적인 Chan-Vese 레벨셋 에너지 기능을 미분 가능한 손실로 사용하여, 은닉적으로 물체 경계 곡선을 진화시킨다.
- 입력 이미지와 딥 페처를 모두 레벨셋 진화에 입력으로 사용하여, 다중 척도 및 다중 수준의 맥락 모델링을 가능하게 한다.
- 각 반복에서 상자 투영 함수가 레벨셋 곡선을 초기화하여, 주어진 경계 상자 내에서 근사적인 경계 추정치를 제공한다.
- 픽셀 유사도 커널 기반의 국소 일치성 모듈이 지역적 공간적 및 외관적 관계를 추출하여 진화 과정에서 일관성을 강화한다.
- 프레임워크는 엔드 투 엔드 학습이 가능한 인스턴스 인식 디코더와 상자 수준 매칭 할당 모듈을 포함하여, 예측을 진짜 경계 상자와 연결한다.
- 레벨셋 에너지 기능은 반복적으로 최소화되어, 픽셀 수준의 감독 없이도 각 경계 상자 내에서 마스크 예측을 정밀하게 개선한다.
실험 결과
연구 질문
- RQ1미분 가능한 에너지 기능을 갖춘 레벨셋 진화가 경계 상자 감독 기반 인스턴스 세분화에 깊이 있는 네트워크에 효과적으로 통합될 수 있는가?
- RQ2유사도 커널을 통한 국소 일치성 모델링은 경계 상자 감독 하에서 마스크 경계 정확도를 어떻게 향상시키는가?
- RQ3레벨셋 진화를 통한 단일 단계 프레임워크가 기존의 쌍별 유사도 기반 방법보다 경계 상자 감독 기반 인스턴스 세분화에서 더 나은 성능을 낼 수 있는가?
- RQ4아키텍처 설계(전이 기반 CNN 대비 트랜스포머)가 레벨셋 기반 마스크 정밀화 성능에 어떤 영향을 미치는가?
- RQ5경계 상자 감독 기반 방법이 완전한 감독 기반 인스턴스 세분화 방법과의 성능 격차를 어느 정도 줄일 수 있는가?
주요 결과
- Swin-Transformer large 백본을 사용하여 Box2Mask는 COCO에서 42.4%의 마스크 AP를 달성하며, 최근의 완전한 마스크 감독 기반 방법과 동등한 성능을 내고 있다.
- 50에포크 학습 스케줄을 사용할 경우, Box2Mask-T는 Pascal VOC에서 41.4%의 마스크 AP를 기록하여 더 긴 학습의 이점이 있음을 보여준다.
- 팽창률 3을 가진 국소 일치성 모듈이 가장 높은 성능(36.3% AP)을 기록하여, 국소 맥락이 전역 맥락보다 더 유익함을 입증한다.
- 픽셀 디코더에 두 개의 MSDeformAtten 레이어를 사용할 경우, 한 개 레이어 대비 2.1% 향상된 마스크 AP를 기록하며, 최적의 성능은 다섯 레이어에서 나타나 39.4% AP를 달성한다.
- 상자 수준 매칭 할당의 최적 균형 가중치는 β₁=2.0 및 β₂=6.0이며, 이는 트랜스포머 기반 모델에서 39.4%의 AP를 달성한다.
- 일반적인 스냅샷, 원격 감시, 의료 영상, 스트리트 라이트 이미지 등 다섯 가지 다양한 벤치마크에서 Box2Mask는 모든 데이터셋에서 새로운 최고 성능을 수립하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.