[논문 리뷰] Open-World Instance Segmentation: Exploiting Pseudo Ground Truth From Learned Pairwise Affinity
이 논문은 개방형 세계에서의 인스턴스 세분화를 위해 일반 그룹화 네트워크(GGNs)를 제안하며, 비라벨링 이미지에서 허위 진짜 마스크를 생성하기 위해 학습된 쌍별 유사도 예측기를 활용한다. 이러한 허위 진짜 마스크를 실제 애너테이션과 결합함으로써 GGNs는 COCO, LVIS, ADE20K, UVO 벤치마크 전반에서 최신 기술 수준(SOTA) 성능을 달성하며, 새로운 카테고리에 대해 기존 폐쇄형 세계 모델보다 뚜렷이 뛰어난 성능을 보이며 도메인 외부 데이터에 대해서도 강력한 일반화 능력을 보여준다.
Open-world instance segmentation is the task of grouping pixels into object instances without any pre-determined taxonomy. This is challenging, as state-of-the-art methods rely on explicit class semantics obtained from large labeled datasets, and out-of-domain evaluation performance drops significantly. Here we propose a novel approach for mask proposals, Generic Grouping Networks (GGNs), constructed without semantic supervision. Our approach combines a local measure of pixel affinity with instance-level mask supervision, producing a training regimen designed to make the model as generic as the data diversity allows. We introduce a method for predicting Pairwise Affinities (PA), a learned local relationship between pairs of pixels. PA generalizes very well to unseen categories. From PA we construct a large set of pseudo-ground-truth instance masks; combined with human-annotated instance masks we train GGNs and significantly outperform the SOTA on open-world instance segmentation on various benchmarks including COCO, LVIS, ADE20K, and UVO. Code is available on project website: https://sites.google.com/view/generic-grouping/.
연구 동기 및 목표
- 기존 모델이 사전 정의된 클래스 계층 구조에 의존함에 따라 개방형 환경에서 새로운 카테고리에 대해 인스턴스 세분화 성능 격차를 해소하기 위해.
- 정의된 의미적 감독 없이도 다양한 새로운 객체 카테고리에 일반화 가능한 클래스 무관 인스턴스 제안 방법을 개발하기 위해.
- 대규모 비라벨링 데이터에서 무 supervisory pairwise 유사도 학습을 통해 유도된 허위 진짜 마스크를 활용하여 모델 일반화 능력을 향상시키기 위해.
- 비라벨링 이미지에서 유도된 허위 진짜 마스크를 사전 훈련하는 것이 이미지넷 감독보다 개방형 세계 일반화에 더 강력한 인덕티브 바이어스를 제공하는지 입증하기 위해.
제안 방법
- 비포괄적인 세분화 마스크를 감독으로 사용하여 국소 픽셀 수준의 관계를 예측하는 쌍별 유사도 예측기(PA)를 훈련함으로써, 새로운 카테고리로의 일반화를 가능하게 한다.
- PA 모델이 생성한 유사도 맵을 그룹화 모듈의 입력으로 사용하여 높은 순위의 클래스 무관 마스크 제안을 생성하며, 이는 허위 진짜 마스크로 기능한다.
- 실제 인간 애너테이션 마스크와 생성된 허위 진짜 마스크를 조합하여 클래스 무관 Mask R-CNN을 엔드 투 엔드로 미세조정함으로써 일반적인 인스턴스 제안 능력을 향상시킨다.
- 이 방법은 대규모 비라벨링 데이터셋(예: ImageNet, OpenImages)에서 사전 훈련함으로써 확장 가능하며, PA 기반 그룹화가 추가적인 데이터 다양성을 제공한다.
- PA 기반 그룹화에서 유도된 객체성 점수와 OLN(개방형 세계 학습 네트워크) 모듈에서 유도된 점수를 조합함으로써 성능을 향상시킨다.
- 모델은 ADE20K와 UVO에서 미세조정 없이 평가되며, 모든 마스크를 진짜 마스크로 간주하여 실제 개방형 세계 조건을 시뮬레이션한다.
실험 결과
연구 질문
- RQ1의미적 감독 없이도 무 supervisory 국소 픽셀 관계를 활용하여 개방형 세계 인스턴스 세분화에서 뛰어난 성능을 달성할 수 있는가?
- RQ2쌍별 유사도에서 유도된 허위 진짜 마스크 생성이 표준 감독 사전 훈련 대비 새로운 카테고리로의 일반화를 향상시키는가?
- RQ3비라벨링 이미지에서 유도된 허위 진짜 마스크를 사전 훈련하면 개방형 세계 설정과 폐쇄형 세계 설정 모두에서 성능에 어떤 영향을 미치는가?
- RQ4PA 기반 그룹화와 기존 개방형 세계 모델(예: OLN)의 조합이 최신 기술 수준 성능을 추가로 향상시킬 수 있는가?
주요 결과
- ADE20K와 UVO에서 GGNs는 Mask R-CNN와 Selective Search보다 뚜렷이 뛰어난 성능을 보이며, 20개의 진짜 마스크 객체 중 14개의 참 양성 제안을 달성한 반면, 각각 5개와 4개를 기록한다.
- LVIS 벤치마크에서 GGN은 허위 진짜 마스크 사전 훈련을 통해 이전 최신 기술 수준(Oln) 대비 평균 재현율(AR@100)을 6.8% 향상시켜 새로운 최신 기술 수준을 확립한다.
- 이미지넷 감독 사전 훈련 대비 이미지넷에서 유도된 허위 진짜 마스크 사전 훈련이 개방형 세계 성능을 1.4% 향상시키지만, 폐쇄형 세계 설정에서는 약간 낮은 성능을 보인다.
- 이미지당 더 많은 허위 진짜 마스크와 사전 훈련 시 더 많은 비라벨링 픽셀을 사용할수록 성능 향상이 이루어지며, 이는 확장 가능성과 노이즈에 대한 강건성을 시사한다.
- 실제 세계 환경에서도 잘 일반화됨: ADE20K와 UVO에서 미세조정 없이 평가했을 때, GGN은 본선 및 새로운 카테고리 모두에서 베이스라인보다 높은 AR과 AP 성능을 기록한다.
- PA 기반 그룹화에서 유도된 객체성 점수와 OLN에서 유도된 점수를 조합함으로써 성능 향상이 이루어지며, 제안 순위 매기기에서 상호 보완적인 강점을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.