[논문 리뷰] Box-supervised Instance Segmentation with Level Set Evolution
이 논문은 유사한 단일 스텝, 엔드 투 엔드 박스-초기화된 인스턴스 세그멘테이션 방법을 제안한다. 이 방법은 미분 가능한 Chan-Vese 에너지 기능을 사용한 반복적 레벨셋 진화를 활용한다. 딥 페처와 입력 이미지를 박스 프로젝션 초기화된 레벨셋과 조합함으로써, COCO, Pascal VOC, iSAID, LiTS 벤치마크에서 최신 기술 수준(SOTA)의 성능을 달성한다. 기존의 약한 감독 방법에 비해 특히 원격 감시 및 의료 영상 분야에서 뚜렷한 성능 향상을 보였다.
In contrast to the fully supervised methods using pixel-wise mask labels, box-supervised instance segmentation takes advantage of the simple box annotations, which has recently attracted a lot of research attentions. In this paper, we propose a novel single-shot box-supervised instance segmentation approach, which integrates the classical level set model with deep neural network delicately. Specifically, our proposed method iteratively learns a series of level sets through a continuous Chan-Vese energy-based function in an end-to-end fashion. A simple mask supervised SOLOv2 model is adapted to predict the instance-aware mask map as the level set for each instance. Both the input image and its deep features are employed as the input data to evolve the level set curves, where a box projection function is employed to obtain the initial boundary. By minimizing the fully differentiable energy function, the level set for each instance is iteratively optimized within its corresponding bounding box annotation. The experimental results on four challenging benchmarks demonstrate the leading performance of our proposed approach to robust instance segmentation in various scenarios. The code is available at: https://github.com/LiWentomng/boxlevelset.
연구 동기 및 목표
- 완전 감독 세그멘테이션의 높은 애너테이션 비용 문제를 해결하기 위해, 오직 경계 상자 애너테이션만을 사용하여 정확한 픽셀 수준의 세그멘테이션을 가능하게 하는 것.
- 복잡한 가짜 레이블링 파이프라인에 의존하거나 과도하게 단순화된 쌍별 유사도 가정에 의존하는 기존 박스-초기화된 방법의 한계를 극복하는 것.
- 레벨셋 곡선을 경계 상자 내에서 반복적으로 진화시켜 정밀한 인스턴스 마스크를 개선하는, 미분 가능하고 엔드 투 엔드 프레임워크를 도입하는 것.
- 마스크 애너테이션이 부족한 도메인, 특히 원격 감시 및 의료 영상에서의 강인성 향상.
- 완전 감독과 박스-초기화된 인스턴스 세그멘테이션 간의 성능 격차를 해소하는 것.
제안 방법
- 이 방법은 연속적인 Chan-Vese 에너지 기능을 사용하여 인스턴스 세그멘테이션 문제를 에너지 최소화 문제로 공식화하며, 이는 완전히 미분 가능하고 엔드 투 엔드 학습에 적합하다.
- SOLOv2 기반 마스크 헤드가 인스턴스 인식 마스크 맵을 예측하여 각 객체의 초기 레벨셋 함수로 기능한다.
- 레벨셋 진화는 장거리 의존성을 지닌 저수준 이미지 데이터와 고수준 딥 페처를 모두 기반으로 하여 경계 정확도를 향상시킨다.
- 박스 프로젝션 함수는 각 반복에서 레벨셋 곡선을 초기화하여 진화 과정이 애너테이션된 경계 상자 내에서 제한되도록 보장한다.
- 에너지 함수는 반복 최적화를 통해 최소화되어 레벨셋 곡선이 정확한 객체 경계로 수렴하도록 한다.
- 구조적 일致성을 유지하고 장거리 의존성을 모델링하기 위해 고수준 페처에 트리 필터를 적용한다.
실험 결과
연구 질문
- RQ1복잡한 가짜 레이블링 파이프라인에 의존하지 않고, 박스-초기화된 조건에서 미분 가능한 레벨셋 진화 프레임워크가 강력한 인스턴스 세그멘테이션 성능을 달성할 수 있는가?
- RQ2저수준 이미지 데이터와 고수준 딥 페처를 모두 통합할 경우, 레벨셋 진화의 강인성과 정확도에 어떤 영향을 미치는가?
- RQ3레벨셋 진화를 경계 상자 영역 내에서 제한함으로써 노이즈 간섭을 줄이고 수렴성을 향상시킬 수 있는가?
- RQ4트리 필터로 향상된 딥 구조적 페처는 원격 감시 및 의료 영상에서 레벨셋 진화에 얼마나 기여하는가?
- RQ5이 방법은 COCO, Pascal VOC, iSAID, LiTS와 같은 다양한 벤치마크에서 박스-초기화 조건 하에 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- COCO 데이터셋에서, 이 방법은 1× 학습 스케줄로 24.7% AP를 달성했고, 3× 스케줄로는 34.4% AP를 기록하여 기존의 박스-초기화된 방법보다 뚜렷이 뛰어난 성능을 보였다.
- iSAID 원격 감시 데이터셋에서, 이 방법은 최신 기술 수준의 성능을 달성하여 기존 접근 방식에 비해 큰 격차를 보였다.
- LiTS 의료 영상 데이터셋에서, 트리 필터링된 페처를 사용할 경우 36.3% AP를 달성하여 낮은 데이터, 고변동성 환경에서의 강력한 일반화 능력을 보였다.
- 절단 실험 결과, 원본 이미지와 딥 페처를 모두 사용할 경우 24.7% AP를 기록하여 단일 입력 변형보다 우수한 성능을 보였다.
- 최적의 고수준 페처 채널 수는 9이며, 이를 10으로 늘리면 노이즈가 많은 의미 정보로 인해 성능이 저하됨을 확인했다.
- 트리 필터는 AP를 1.9% 향상시켰다(34.4%에서 36.3%로), 레벨셋 진화 과정에서 구조적 일관성을 유지하는 데 효과적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.