[논문 리뷰] Learning to Segment Every Thing
이 논문은 COCO의 80개 클래스에 마스크 주석이 있고 Visual Genome의 3000개 클래스에 박스 주석만 있는 혼합 데이터로 Mask R-CNN을 훈련시키는 부분적으로 감독받는 인스턴스 세그멘테이션 프레임워크를 제안한다. 이는 탐지 특징에서 세그멘테이션 마스크를 예측하기 위해 학습된 가중치 전이 함수를 사용한다. 이 방법은 새로운 카테고리에서 마스크 AP에 40%의 상대적 향상을 달성하여, 마스크 주석을 최소로 사용함으로써 수천 개의 개념에 걸쳐 대규모 인스턴스 세그멘테이션을 가능하게 한다.
Most methods for object instance segmentation require all training examples to be labeled with segmentation masks. This requirement makes it expensive to annotate new categories and has restricted instance segmentation models to ~100 well-annotated classes. The goal of this paper is to propose a new partially supervised training paradigm, together with a novel weight transfer function, that enables training instance segmentation models on a large set of categories all of which have box annotations, but only a small fraction of which have mask annotations. These contributions allow us to train Mask R-CNN to detect and segment 3000 visual concepts using box annotations from the Visual Genome dataset and mask annotations from the 80 classes in the COCO dataset. We evaluate our approach in a controlled study on the COCO dataset. This work is a first step towards instance segmentation models that have broad comprehension of the visual world.
연구 동기 및 목표
- 모든 클래스에 대해 완전한 마스크 주석이 필요하지 않은 채로 수천 개의 객체 카테고리로 일반화되는 인스턴스 세그멘테이션 모델을 가능하게 하기 위해.
- 인스턴스 마스크 주석의 높은 비용과 부족함을 보완하기 위해 풍부하고 저렴한 박스 주석을 활용하기 위해.
- 탐지 특징을 입력으로만 사용하여 새로운 카테고리에 대해 마스크 예측을 가능하게 하는 전이 학습 방법을 개발하기 위해.
- 기존 모델의 일반적인 100개 클래스 제한을 초월하여 광범위한 시각적 세계 이해를 가능하게 하기 위해.
- Visual Genome 및 COCO와 같은 데이터셋으로부터 부분적인 감독을 통해 대규모 인스턴스 세그멘테이션의 실현 가능성을 입증하기 위해.
제안 방법
- 단지 일부 클래스(80개 COCO 클래스)에 마스크 주석이 있고, 나머지 클래스(3000개 VG 클래스)에는 박스 주석만 있는, 새로운 부분적으로 감독받는 인스턴스 세그멘테이션 작업을 제안한다.
- 각 클래스의 탐지 헤드 특징에서 세그멘테이션 마스크 헤드 가중치를 예측하는 매aram터화된 가중치 전이 함수 $\mathcal{T}$ 를 도입한다.
- 마스크 주석이 있는 80개 클래스만을 사용하여 가중치 전이 함수를 엔드 투 엔드로 훈련시켜, 추론 시에 새로운 클래스로 전이할 수 있도록 한다.
- 다양한 카테고리 간 일반화를 향상시키기 위해 마스크 헤드에 클래스에 관계없는 다층 퍼셉트론(MLP)을 추가한다.
- 두 단계 훈련 전략을 적용한다: 먼저 Visual Genome의 박스 주석을 사용해 3000개 클래스에 대해 Faster R-CNN 탐지기를 훈련하고, 그 다음 COCO 마스크를 사용해 가중치 전이 함수로 마스크 헤드를 미세조정한다.
- 백본 네트워크로 ResNet-101-FPN를 사용하고, COCO(정량적 평가를 위해)와 Visual Genome(정성적 확장성을 위해)에서 이 방법을 적용한다.
실험 결과
연구 질문
- RQ1대부분의 클래스에 대해 박스 주석만 있고 소수의 클래스에 마스크 주석이 있는 경우, 딥 러닝 모델이 수천 개의 객체 카테고리로 인스턴스 세그멘테이션을 일반화할 수 있는가?
- RQ2학습된 가중치 전이 함수는 새로운 카테고리에 걸쳐 탐지 특징에서 세그멘테이션 마스크 예측으로 지식을 전이하는 데 얼마나 효과적인가?
- RQ3COCO와 같이 마스크 주석이 있는 소수의 클래스로 훈련된 모델이, 의미적으로 다양하고 박스 주석만 있는 훨씬 더 큰 수의 클래스(예: Visual Genome)로 얼마나 일반화되는가?
- RQ4실세계 데이터셋에서 부분적 감독으로 훈련된 대규모 인스턴스 세그멘테이션 모델의 정성적 능력은 어떠한가?
- RQ5제안된 방법은 마스크 주석이 전혀 없는 카테고리에서 강력한 베이스라인 대비 마스크 AP를 크게 향상시킬 수 있는가?
주요 결과
- COCO 데이터셋에서 제안된 방법은 마스크 주석이 없는 카테고리에서 강력한 베이스라인 대비 마스크 AP에 40%의 상대적 향상을 달성한다.
- 이 방법은 마스크 주석이 없는 클래스에서 마스크 AP가 20% 이상 높은 GrabCut 마스크로 훈련된 Mask R-CNN보다도 성능이 뛰어나다.
- 가중치 전이 함수는 효과적인 일반화를 가능하게 한다: 마스크 주석이 없더라도, COCO와 겹치지 않는 2920개의 Visual Genome 클래스에 대해 합리적인 세그멘테이션 마스크를 생성한다.
- Visual Genome에서의 정성적 결과는 모델이 그림자나 길 같은 추상적 개념을 세그멘테이션하고, 전체 객체와 부분(예: 창문, 손잡이)을 구분할 수 있음을 보여준다.
- 모델는 'thing'-유형의 개념(예: 고립된 나무)보다 'stuff'-유형의 개념(예: 숲)을 덜 신뢰성 있게 세그멘테이션하는 것으로 나타나, 의미적 모호성 처리에 한계가 있음을 시사한다.
- 이 방법은 다양한 백본 아키텍처로도 일반화되며, ResNet-50-FPN와 ResNet-101-FPN 백본 모두에서 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.