[논문 리뷰] DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence from Box Supervision
DiscoBox는 유한한 경계 상자 애너테이션만을 사용하여 약한 감독 하에 개체 세분화와 의미적 대응을 동시에 학습하는 자기 앙상블 프레임워크를 제안한다. 단일, 이원 및 교차 이미지 잠재변수를 갖는 구조적 티처 모델을 활용하여 두 작업 모두에 대한 가짜 레이블을 생성함으로써, 최신 기술 수준의 성능을 달성한다: COCO에서 37.9% AP와 PASCAL VOC12 및 PF-PASCAL에서 최고 성능을 기록한다.
We introduce DiscoBox, a novel framework that jointly learns instance segmentation and semantic correspondence using bounding box supervision. Specifically, we propose a self-ensembling framework where instance segmentation and semantic correspondence are jointly guided by a structured teacher in addition to the bounding box supervision. The teacher is a structured energy model incorporating a pairwise potential and a cross-image potential to model the pairwise pixel relationships both within and across the boxes. Minimizing the teacher energy simultaneously yields refined object masks and dense correspondences between intra-class objects, which are taken as pseudo-labels to supervise the task network and provide positive/negative correspondence pairs for dense constrastive learning. We show a symbiotic relationship where the two tasks mutually benefit from each other. Our best model achieves 37.9% AP on COCO instance segmentation, surpassing prior weakly supervised methods and is competitive to supervised methods. We also obtain state of the art weakly supervised results on PASCAL VOC12 and PF-PASCAL with real-time inference.
연구 동기 및 목표
- 개체 세분화 마스크와 조밀한 의미적 대응을 동시에 포함하는 대규모 데이터셋의 부족을 해결한다.
- 개체 세분화와 의미적 대응을 별도로 처리하는 기존 접근법의 한계를 극복하기 위해 상호 보완적 감독을 가능하게 한다.
- 경계 상자 애너테이션만을 사용하여 개체 세분화와 의미적 대응을 위한 모델을 훈련할 수 있는 약한 감독 프레임워크를 개발한다.
- 정밀한 국소화가 대응 품질을 향상시키고 그 반대도 성립하는 상호 보완적 학습 관계를 수립한다.
- PASCAL 3D+에서 원칙적인 평가 지표를 갖춘 다중 객체 벤치마크와 함께 의미적 대응을 위한 새로운 벤치마크를 도입한다.
제안 방법
- 경계 상자 감독 하에 초기 마스크와 대응을 예측하는 작업 네트워크를 갖는 자기 앙상블 프레임워크를 설계한다.
- 단일, 이원 및 교차 이미지 잠재변수를 갖는 구조적 티처 모델을 설계하여 예측을 정교화한다.
- 티처의 에너지 최소화를 통해 개체 세분화와 조밀한 대응 모두에 대한 고품질의 가짜 레이블을 생성한다.
- 티처의 출력에서 유도된 긍정 및 부정 대응 쌍을 활용한 조밀한 대비 학습을 통합하여 표현 학습을 향상시킨다.
- 클래스 내 대응과 개체 국소화를 상호 보조 신호로 활용하여 상자 감독에서의 모호함을 줄인다.
- 티처로부터 생성된 가짜 레이블을 사용하여 작업 네트워크를 엔드 투 엔드로 훈련함으로써 대규모 약한 감독 데이터에 대한 확장 가능한 훈련을 가능하게 한다.
실험 결과
연구 질문
- RQ1경계 상자 감독만으로도 개체 세분화와 의미적 대응을 동시에 학습할 수 있는가?
- RQ2내부 및 교차 이미지 잠재변수를 갖는 구조적 티처 모델은 두 작업 모두의 가짜 레이블 품질을 어떻게 향상시키는가?
- RQ3약한 감독 하에서 조밀한 대비 학습은 대응 및 세분화 표현 향상에 어떤 영향을 미치는가?
- RQ4국소화와 대응 간의 상호 감독은 상자 감독 학습에서 비의미적인 해법을 줄이는 데 기여하는가?
- RQ5제안된 프레임워크는 다중 객체 시나리오로 일반화되며, 기존의 약한 감독 방법보다 의미적 대응 벤치마크에서 더 우수한 성능을 보이는가?
주요 결과
- DiscoBox는 COCO 개체 세분화에서 37.9% AP를 달성하여 YOLACT++(34.6% AP) 및 Mask R-CNN(37.1% AP)과 같은 감독 학습 방법을 초월한다.
- PASCAL VOC12에서 DiscoBox는 59.3% PCK@0.05를 기록하여 이전 최고 성능 방법인 DCC-Net(55.6%)과 NC-Net(54.3%)를 앞서며 우수한 성능을 보였다.
- PF-PASCAL 벤치마크에서 DiscoBox는 95.3% PCK@0.15를 달성하여 SF-Net(90.6%) 및 DHPF(91.1%)를 크게 앞서며 약한 감독 하 의미적 대응에서 최고 성능을 기록했다.
- PASCAL 3D+에서 DiscoBox는 31.7% AP를 기록하여 SCOT(29.3%)와 아웃풋된 DiscoBox-(30.9%)를 앞서며 전체 프레임워크의 효과성을 입증했다.
- 절단 실험 결과, 조밀한 대비 학습과 구조적 티처가 성능 향상에 핵심 요소임을 확인하였으며, 티처만으로도 베이스라인 대비 1.8% AP 향상이 이루어졌다.
- 프레임워크는 COCO, VOC12, PF-PASCAL, PASCAL 3D+ 등 다양한 데이터셋에서 테스트 벤치마크에 대한 미세조정 없이도 잘 일반화됨을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.