Skip to main content
QUICK REVIEW

[논문 리뷰] Instance Segmentation with Point Supervision

Issam Laradji, Negar Rostamzadeh|arXiv (Cornell University)|2019. 06. 14.
Advanced Neural Network Applications참고 문헌 54인용 수 13
한 줄 요약

이 논문은 한 객체당 하나의 레이블링된 점만 필요로 하는 점 수준의 애너테이션으로만 훈련되는 약한 감독형 인스턴스 세그멘테이션 방법 WISE를 제안한다. 이 방법은 두 가지 브랜치로 구성된 네트워크를 사용한다: 객체 중심을 예측하는 로컬라이제이션 네트워크(L-Net)와 유사한 특징을 가진 픽셀을 군집화하여 마스크를 생성하는 임베딩 네트워크(E-Net). 제안된 방법은 완전 감독 모델과 경쟁 가능한 성능을 달성하며, PASCAL VOC, COCO, KITTI, CityScapes에서 점 수준의 감독을 받는 인스턴스 세그멘테이션에 대해 새로운 강력한 베이스라인을 설정한다.

ABSTRACT

Instance segmentation methods often require costly per-pixel labels. We propose a method that only requires point-level annotations. During training, the model only has access to a single pixel label per object, yet the task is to output full segmentation masks. To address this challenge, we construct a network with two branches: (1) a localization network (L-Net) that predicts the location of each object; and (2) an embedding network (E-Net) that learns an embedding space where pixels of the same object are close. The segmentation masks for the located objects are obtained by grouping pixels with similar embeddings. At training time, while L-Net only requires point-level annotations, E-Net uses pseudo-labels generated by a class-agnostic object proposal method. We evaluate our approach on PASCAL VOC, COCO, KITTI and CityScapes datasets. The experiments show that our method (1) obtains competitive results compared to fully-supervised methods in certain scenarios; (2) outperforms fully- and weakly- supervised methods with a fixed annotation budget; and (3) is a first strong baseline for instance segmentation with point-level supervision.

연구 동기 및 목표

  • 완전 감독형 인스턴스 세그멘테이션의 높은 애너테이션 비용 문제를 해결하기 위해, 매 픽셀 애너테이션이 필요로 하는 문제를 다루기 위함이다.
  • 점 애너테이션이 픽셀 수준의 레이블보다 약 10배 정도 빠르게 수집될 수 있다는 점을 고려해, 점 수준의 감독을 더 효율적인 대안으로 탐색하기 위함이다.
  • 완전한 마스크가 훈련 중에 제공되지 않더라도, 한 객체당 하나의 점만을 사용하여 경쟁 가능한 인스턴스 세그멘테이션 성능을 달성하는 방법을 개발하기 위함이다.
  • 점 수준의 감독 하에 인스턴스 세그멘테이션의 강력한 베이스라인을 설정하기 위함이며, 이는 아직 거의 탐색되지 않은 약한 감독 설정이다.

제안 방법

  • 이 방법은 두 브랜치 아키텍처를 사용한다: 점 수준의 감독을 통해 객체 중심 위치를 예측하는 L-Net.
  • E-Net은 같은 객체에 属하는 픽셀이 임베딩 공간에서 가까이 군집되도록 학습하며, 유사성 기반으로 마스크 그룹화를 가능하게 한다.
  • 훈련 중에 진짜 마스크가 제공되지 않기 때문에, E-Net은 클래스 무관 객체 제안 방법을 통해 생성된 가짜 마스크로 감독된다.
  • 추론 시점에 L-Net은 객체 중심을 예측하고, E-Net은 모든 픽셀에 임베딩을 할당하며, 이를 기반으로 최종 마스크를 생성한다.
  • 최종 마스크는 국소화 및 경계 정확도 향상을 위해 객체 제안 방법을 통해 정밀화된다.
  • 모델은 L-Net용 로컬라이제이션 손실과 E-Net용 대비 임베딩 손실을 조합하여 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1매 픽셀 애너테이션이 전혀 필요 없이, 한 객체당 하나의 점만을 사용하여 인스턴스 세그멘테이션을 효과적으로 훈련시킬 수 있는가?
  • RQ2동일한 애너테이션 예산 하에서 점 수준의 감독으로 훈련된 모델의 성능은 완전 감독 모델과 비교해 어떻게 되는가?
  • RQ3객체 제안에서 유도된 가짜 마스크를 사용하는 임베딩 기반 접근 방식이 경쟁 가능한 인스턴스 세그멘테이션 성능을 달성할 수 있는가?
  • RQ4애너테이션 비용이 제한된 조건에서 제안된 방법이 기존의 약한 감독 베이스라인을 초월할 수 있는가?

주요 결과

  • WISE는 PASCAL VOC와 COCO에서 경쟁 가능한 인스턴스 세그멘테이션 성능를 달성하며, 고정된 애너테이션 예산 하에서 완전 감독 및 약한 감독 방법을 모두 능가한다.
  • KITTI에서 WISE는 MWCov 74.2와 MUCov 58.9를 기록하여, 기존의 'L-Net + 최고의 제안' 기반 베이스라인을 크게 능가하며, 강력한 약한 감독 베이스라인을 확립한다.
  • CityScapes에서 WISE는 AP 7.8을 기록하였으며, 이는 완전 감독 모델에 비해 낮지만, 이 설정에서 점 수준의 감독을 받는 인스턴스 세그멘테이션에 대해 새로운 강력한 베이스라인을 설정한다.
  • 진짜 마스크가 아닌 진짜 점을 E-Net에 입력으로 사용할 경우, 차량에 대해 77.6 mAP, 인물에 대해 55.4, 신호등에 대해 77.8, 교통 표지판에 대해 80.1을 기록하며, 일부 카테고리에서는 테스트 시에 바운딩 박스를 사용하는 방법을 초월한다.
  • 절연 분석 결과, 단지 최고의 제안에 의존하는 것보다 E-Net이 마스크 품질을 향상시킴을 확인하여, 학습된 임베딩의 가치를 입증한다.
  • 정성적 결과는 WISE가 모든 데이터셋에서 다양한 객체 카테고리(자동차, 인물, 교통 표지판 등)에 대해 정확한 마스크를 성공적으로 생성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.