Skip to main content
QUICK REVIEW

[논문 리뷰] Pointly-Supervised Instance Segmentation

Bowen Cheng, Omkar Parkhi|arXiv (Cornell University)|2021. 04. 13.
Advanced Neural Network Applications참고 문헌 59인용 수 4
한 줄 요약

이 논문은 객체의 바운딩 박내에서 랜덤으로 10개의 점을 선택하여 배경 또는 전경으로 레이블링하는 단순한 점 기반 약한 지도 학습 기법을 제안한다. 놀랍게도, 각 객체당 단 10개의 점만으로도 Mask R-CNN이 COCO, PASCAL VOC, Cityscapes, LVIS에서 완전 지도 학습 성능의 94%~98%를 달성한다. 이는 전체 마스크 레이블링보다 약 5배 빠른 어노테이션 속도를 제공한다. 또한 저자들은 점 좌표와 특징에서 직접 마스크 예측을 생성하는 간소화된 아키텍처인 Implicit PointRend를 도입하여, 단일 점 수준의 손실만을 사용함으로써 강력한 성능을 달성한다.

ABSTRACT

We propose an embarrassingly simple point annotation scheme to collect weak supervision for instance segmentation. In addition to bounding boxes, we collect binary labels for a set of points uniformly sampled inside each bounding box. We show that the existing instance segmentation models developed for full mask supervision can be seamlessly trained with point-based supervision collected via our scheme. Remarkably, Mask R-CNN trained on COCO, PASCAL VOC, Cityscapes, and LVIS with only 10 annotated random points per object achieves 94%--98% of its fully-supervised performance, setting a strong baseline for weakly-supervised instance segmentation. The new point annotation scheme is approximately 5 times faster than annotating full object masks, making high-quality instance segmentation more accessible in practice. Inspired by the point-based annotation form, we propose a modification to PointRend instance segmentation module. For each object, the new architecture, called Implicit PointRend, generates parameters for a function that makes the final point-level mask prediction. Implicit PointRend is more straightforward and uses a single point-level mask loss. Our experiments show that the new module is more suitable for the point-based supervision.

연구 동기 및 목표

  • 모델 성능을 저하시키지 않고 어노테이션 시간을 크게 줄일 수 있는 실용적이고 효율적인 인스턴스 세그멘테이션을 위한 약한 지도 학습 기법을 개발하는 것.
  • Mask R-CNN과 같은 최신 인스턴스 세그멘테이션 모델을 효과적으로 지도 학습할 수 있도록, 객체당 소수의 점 레이블(10개)이 충분한가를 입증하는 것.
  • 기존 아키텍처인 PointRend와 비교해 복잡한 구성 요소(예: 거친 마스크 예측, 중요도 샘플링)를 제거한, 점 기반 지도 학습에 특화된 새로운 인스턴스 세그멘테이션 모듈인 Implicit PointRend를 설계하는 것.
  • COCO, PASCAL VOC, LVIS, Cityscapes 등 다양한 데이터셋에서 실제 어노테이션 시간 제약 조건 하에 점 기반 지도 학습의 성능을 평가하는 것.

제안 방법

  • 각 객체의 바운딩 박내에서 랜덤으로 10개의 점을 추출하고 전경 또는 배경으로 레이블링하는 점 어노테이션 기법을 제안하여, 최소한의 인간 노력으로도 약한 지도 학습을 가능하게 한다.
  • 기존의 인스턴스 세그멘테이션 모델들(예: Mask R-CNN, PointRend, CondInst)을 점 수준의 지도 학습에 적응시키기 위해, 보간을 통해 어노테이션된 점 위치에서만 마스크 손실을 계산한다.
  • 점 좌표와 이미지 수준의 특징을 입력으로 받아 마스크 예측을 생성하는 새로운 아키텍처인 Implicit PointRend를 도입하여, 거친 마스크 예측 및 중요도 샘플링이 필요 없도록 한다.
  • 객체 박내에서 점의 상대적 좌표를 표현하기 위해 위치 인코딩을 사용하여 공간 인식 능력을 향상시키며, 추가적인 지도 학습 없이도 성능 향상을 이룬다.
  • 학습 중에 단일 점 수준의 마스크 손실만을 사용하여 파이프라인을 단순화하고 점 기반 지도 학습과의 호환성을 향상시킨다.
  • 점 기반 데이터 증강 및 자기 학습을 적용하여, 약한 지도 학습과 완전 지도 학습 간의 성능 격차를 더욱 줄인다.

실험 결과

연구 질문

  • RQ1객체의 바운딩 박내에서 랜덤으로 추출하고 레이블링한 소수의 점들이 인스턴스 세그멘테이션 모델에 효과적인 약한 지도 학습 신호가 될 수 있는가?
  • RQ2각 객체당 단 10개의 점 레이블만으로도 Mask R-CNN이 대규모 데이터셋에서 완전 지도 학습 성능에 얼마나 가까이 도달할 수 있는가?
  • RQ3PointRend와 같은 기존 아키텍처보다 더 단순하고 효율적인, 점 기반 지도 학습에 특화된 새로운 인스턴스 세그멘테이션 모듈을 설계할 수 있는가?
  • RQ4COCO, PASCAL VOC, LVIS, Cityscapes와 같은 다양한 데이터셋에서 점 기반 지도 학습의 성능는 어떻게 평가되는가?

주요 결과

  • Mask R-CNN이 각 객체당 단 10개의 점 레이블만으로도 COCO, PASCAL VOC, Cityscapes, LVIS에서 완전 지도 학습 성능의 94%~98%를 달성하여, 다양한 데이터셋 간에 뛰어난 일반화 능력을 입증한다.
  • 제안된 점 어노테이션 기법은 다각형 기반 마스크 어노테이션 대비 어노테이션 시간을 약 5배 단축시키며, 객체당 평균 16초(바운딩 박크 7초 + 10개 점 어노테이션 9초)가 소요된다.
  • Implicit PointRend는 점 기반 지도 학습 하에서 표준 PointRend를 능가하며, 완전 마스크 지도 학습 조건에서도 동일한 성능을 달성한다. 이는 거친 마스크 예측 및 중요도 샘플링 없이도 간소한 아키텍처로도 높은 성능을 낼 수 있음을 보여준다.
  • 상대적 좌표 인코딩과 이미지 수준의 특징(예: FPN p2)을 추가하면 Implicit PointRend의 성능이 최대 1.7 AP 향상되며, 위치 인코딩만으로도 합리적인 기준 성능을 확보한다.
  • ResNet-50 백본과 3배 학습률 스케줄링을 사용할 경우, 전체 마스크 지도 학습에서 COCO에서 38.5 AP를 기록하며, CondInst를 초월하고 PointRend 수준의 성능에 근접한다.
  • 점 기반 지도 학습에 자기 학습 및 데이터 증강을 적용하면 약한 지도 학습과 완전 지도 학습 간의 성능 격차가 더욱 줄어들며, 제한된 어노테이션 자원으로도 실용적인 적용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.