Skip to main content
QUICK REVIEW

[논문 리뷰] OpenVIS: Open-vocabulary Video Instance Segmentation

Pinxue Guo, Tony Jun Huang|arXiv (Cornell University)|2023. 05. 26.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 텍스트 프롬프트를 통해 학습 데이터에 포함되지 않은 카테고리일지라도 어떤 객체든 제로샷 검출, 분할, 추적을 가능하게 하는 새로운 오픈 뷰어티 비디오 인스턴스 세그멘테이션 작업인 OpenVIS를 소개한다. 이 작업은 사전 학습된 시각-언어 모델(예: CLIP)과의 호환성을 높이기 위해 이중 손실로 학습된 마스크 제안 네트워크와 SquareCrop 후처리 전략을 사용하는 이단계 프레임워크를 제안하며, BURST 데이터셋에서 전수 supervision 기반 베이스라인 대비 148% 향상된 성능을 기록한다.

ABSTRACT

Open-vocabulary Video Instance Segmentation (OpenVIS) can simultaneously detect, segment, and track arbitrary object categories in a video, without being constrained to categories seen during training. In this work, we propose InstFormer, a carefully designed framework for the OpenVIS task that achieves powerful open-vocabulary capabilities through lightweight fine-tuning with limited-category data. InstFormer begins with the open-world mask proposal network, encouraged to propose all potential instance class-agnostic masks by the contrastive instance margin loss. Next, we introduce InstCLIP, adapted from pre-trained CLIP with Instance Guidance Attention, which encodes open-vocabulary instance tokens efficiently. These instance tokens not only enable open-vocabulary classification but also offer strong universal tracking capabilities. Furthermore, to prevent the tracking module from being constrained by the training data with limited categories, we propose the universal rollout association, which transforms the tracking problem into predicting the next frame's instance tracking token. The experimental results demonstrate the proposed InstFormer achieve state-of-the-art capabilities on a comprehensive OpenVIS evaluation benchmark, while also achieves competitive performance in fully supervised VIS task.

연구 동기 및 목표

  • 기존 비디오 인스턴스 세그멘테이션 모델이 학습 데이터에 포함된 고정된 닫힘 집합 카테고리에만 객체를 인식할 수 있는 한계를 해결하기 위해.
  • 학습 중에 볼 수 없었던 카테고리라도 텍스트 프롬프트로 묘사된 어떤 객체든 제로샷 분할을 가능하게 하기 위해.
  • 기존 데이터셋을 활용하여 오픈 뷰어티 비디오 인스턴스 세그멘테이션을 위한 강력한 평가 벤치마크를 개발하여 제로샷 일반화 능력을 측정하기 위해.
  • 마스크된 객체 제안과 사전 학습된 시각-언어 모델(VLMs, 예: CLIP) 간의 호환성을 향상시키기 위해. 이는 입력 왜곡과 종횡비에 민감한 모델을 고려한 것이다.
  • 오픈 뷰어티 성능을 극대화하기 위해 다양한 백본 아키텍처와 학습 데이터 제도의 효과를 탐색하기 위해.

제안 방법

  • 분류 헤드를 이중 교차 엔트로피 손실로 학습된 인스턴스 헤드로 대체하여, 카테고리에 관계없이 잠재적인 모든 객체를 제안하도록 하는 쿼리 기반 마스크 제안 네트워크를 개선한다.
  • 마스크 제안을 정사각형 종횡비로 자르면서 객체 내용을 유지하고 왜곡을 최소화하는 새로운 SquareCrop 후처리 전략을 적용하여 CLIP과의 호환성을 향상시킨다.
  • 사전 학습된 시각-언어 모델(CLIP)을 사용하여 각 제안과 후보 텍스트 설명 집합 간의 시각-언어 유사도를 계산하고, 가장 유사한 카테고리를 할당한다.
  • 마스크 어노테이션이 있지만 카테고리 레이블이 없는 COCO 및 YouTube-VIS 데이터셋 조합(C+Y’)을 사용해 마스크 제안 네트워크를 학습함으로써, 알려지지 않은 클래스로의 일반화를 가능하게 한다.
  • 마스크 제안에 대해 대조 학습 목표를 사용해 CLIP 시각 인코더를 미세조정함으로써, 시각적 표현을 최종 세그멘테이션 작업과 더 잘 일치시킨다.
  • COCO 외의 희귀 및 알려지지 않은 카테고리에 대한 마스크 제안 품질 향상을 위해, 마스크 어노테이션만 있는 UVO 데이터셋을 사용해 추가 사전 학습한다.

실험 결과

연구 질문

  • RQ1학습 중에 카테고리 레이블이 필요 없이 텍스트 프롬프트만으로도 비디오 인스턴스 세그멘테이션 모델을 효과적으로 제로샷 오픈 뷰어티 인식으로 확장할 수 있는가?
  • RQ2학습 카테고리 집합 외의 객체도 포함하여, 모든 잠재적 객체에 대해 고급 품질의 클래스 무관 마스크를 생성하도록 마스크 제안 네트워크를 최적화할 수 있는가?
  • RQ3사전 학습된 VLMs(예: CLIP)를 사용할 때, 마스크 제안의 후처리 전략 중 어떤 것이 제로샷 분류 정확도를 최대화하는가?
  • RQ4백본 아키텍처와 학습 데이터(특히 마스크 어노테이션만 있는 경우)의 선택이 오픈 뷰어티 비디오 인스턴스 세그멘테이션 성능에 미치는 영향은 어떠한가?
  • RQ5제안된 프레임워크는 COCO 데이터셋에 포함되지 않은 희귀 및 알려지지 않은 카테고리로까지 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 OpenVIS 프레임워크는 BURST 데이터셋에서 전수 supervision 기반 베이스라인 대비 평균 정밀도(AP)에서 148% 향상되어 강력한 제로샷 일반화 능력을 입증한다.
  • SquareCrop 후처리 전략은 BURST 검증 세트에서 직접 마스크 입력 대비 21% (절대값), 경계상자 크기 조정 후 처리 대비 23% 향상된 CLIP 기반 분류 정확도를 기록한다.
  • Swin-L 백본과 ViT-B CLIP 인코더를 사용하고 UVO 데이터셋(C+U’)에서 학습한 경우, BURST에서 AP가 4.97에 도달하여 더 큰 모델과 더 많은 데이터에서의 확장성 잠재력을 보여준다.
  • COCO에 포함되지 않은 희귀 404개 카테고리에서, Swin-L 백본을 사용한 경우 AP가 4.15를 기록하여 희귀 및 알려지지 않은 클래스에서 강력한 성능을 보인다.
  • ViT-B를 CLIP 시각 인코더로 사용한 경우 AP가 3.48, ResNet-50를 사용한 경우 2.56를 기록하여 다양한 백본 구성에서 일관된 성능 향상을 확인한다.
  • 제거 실험을 통해 마스크 제안 네트워크에서 이중 손실이 마스크 커버리지와 잠재적 인스턴스 탐지 능력을 크게 향상시키며, 특히 희귀 카테고리에서 유의미한 개선을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.