Skip to main content
QUICK REVIEW

[논문 리뷰] DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence from Box Supervision

Shiyi Lan, Zhiding Yu|arXiv (Cornell University)|2021. 05. 13.
Advanced Neural Network Applications참고 문헌 94인용 수 5
한 줄 요약

DiscoBox는 유한한 경계 상자 애너테이션만을 사용하여 약한 감독 하에 개체 세분화와 의미적 대응을 동시에 학습하는 자기 앙상블 프레임워크를 제안한다. 단일, 이원 및 교차 이미지 잠재변수를 갖는 구조적 티처 모델을 활용하여 두 작업 모두에 대한 가짜 레이블을 생성함으로써, 최신 기술 수준의 성능을 달성한다: COCO에서 37.9% AP와 PASCAL VOC12 및 PF-PASCAL에서 최고 성능을 기록한다.

ABSTRACT

We introduce DiscoBox, a novel framework that jointly learns instance segmentation and semantic correspondence using bounding box supervision. Specifically, we propose a self-ensembling framework where instance segmentation and semantic correspondence are jointly guided by a structured teacher in addition to the bounding box supervision. The teacher is a structured energy model incorporating a pairwise potential and a cross-image potential to model the pairwise pixel relationships both within and across the boxes. Minimizing the teacher energy simultaneously yields refined object masks and dense correspondences between intra-class objects, which are taken as pseudo-labels to supervise the task network and provide positive/negative correspondence pairs for dense constrastive learning. We show a symbiotic relationship where the two tasks mutually benefit from each other. Our best model achieves 37.9% AP on COCO instance segmentation, surpassing prior weakly supervised methods and is competitive to supervised methods. We also obtain state of the art weakly supervised results on PASCAL VOC12 and PF-PASCAL with real-time inference.

연구 동기 및 목표

  • 개체 세분화 마스크와 조밀한 의미적 대응을 동시에 포함하는 대규모 데이터셋의 부족을 해결한다.
  • 개체 세분화와 의미적 대응을 별도로 처리하는 기존 접근법의 한계를 극복하기 위해 상호 보완적 감독을 가능하게 한다.
  • 경계 상자 애너테이션만을 사용하여 개체 세분화와 의미적 대응을 위한 모델을 훈련할 수 있는 약한 감독 프레임워크를 개발한다.
  • 정밀한 국소화가 대응 품질을 향상시키고 그 반대도 성립하는 상호 보완적 학습 관계를 수립한다.
  • PASCAL 3D+에서 원칙적인 평가 지표를 갖춘 다중 객체 벤치마크와 함께 의미적 대응을 위한 새로운 벤치마크를 도입한다.

제안 방법

  • 경계 상자 감독 하에 초기 마스크와 대응을 예측하는 작업 네트워크를 갖는 자기 앙상블 프레임워크를 설계한다.
  • 단일, 이원 및 교차 이미지 잠재변수를 갖는 구조적 티처 모델을 설계하여 예측을 정교화한다.
  • 티처의 에너지 최소화를 통해 개체 세분화와 조밀한 대응 모두에 대한 고품질의 가짜 레이블을 생성한다.
  • 티처의 출력에서 유도된 긍정 및 부정 대응 쌍을 활용한 조밀한 대비 학습을 통합하여 표현 학습을 향상시킨다.
  • 클래스 내 대응과 개체 국소화를 상호 보조 신호로 활용하여 상자 감독에서의 모호함을 줄인다.
  • 티처로부터 생성된 가짜 레이블을 사용하여 작업 네트워크를 엔드 투 엔드로 훈련함으로써 대규모 약한 감독 데이터에 대한 확장 가능한 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1경계 상자 감독만으로도 개체 세분화와 의미적 대응을 동시에 학습할 수 있는가?
  • RQ2내부 및 교차 이미지 잠재변수를 갖는 구조적 티처 모델은 두 작업 모두의 가짜 레이블 품질을 어떻게 향상시키는가?
  • RQ3약한 감독 하에서 조밀한 대비 학습은 대응 및 세분화 표현 향상에 어떤 영향을 미치는가?
  • RQ4국소화와 대응 간의 상호 감독은 상자 감독 학습에서 비의미적인 해법을 줄이는 데 기여하는가?
  • RQ5제안된 프레임워크는 다중 객체 시나리오로 일반화되며, 기존의 약한 감독 방법보다 의미적 대응 벤치마크에서 더 우수한 성능을 보이는가?

주요 결과

  • DiscoBox는 COCO 개체 세분화에서 37.9% AP를 달성하여 YOLACT++(34.6% AP) 및 Mask R-CNN(37.1% AP)과 같은 감독 학습 방법을 초월한다.
  • PASCAL VOC12에서 DiscoBox는 59.3% PCK@0.05를 기록하여 이전 최고 성능 방법인 DCC-Net(55.6%)과 NC-Net(54.3%)를 앞서며 우수한 성능을 보였다.
  • PF-PASCAL 벤치마크에서 DiscoBox는 95.3% PCK@0.15를 달성하여 SF-Net(90.6%) 및 DHPF(91.1%)를 크게 앞서며 약한 감독 하 의미적 대응에서 최고 성능을 기록했다.
  • PASCAL 3D+에서 DiscoBox는 31.7% AP를 기록하여 SCOT(29.3%)와 아웃풋된 DiscoBox-(30.9%)를 앞서며 전체 프레임워크의 효과성을 입증했다.
  • 절단 실험 결과, 조밀한 대비 학습과 구조적 티처가 성능 향상에 핵심 요소임을 확인하였으며, 티처만으로도 베이스라인 대비 1.8% AP 향상이 이루어졌다.
  • 프레임워크는 COCO, VOC12, PF-PASCAL, PASCAL 3D+ 등 다양한 데이터셋에서 테스트 벤치마크에 대한 미세조정 없이도 잘 일반화됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.