Skip to main content
QUICK REVIEW

[논문 리뷰] FastInst: A Simple Query-Based Model for Real-Time Instance Segmentation

Junjie He, Pengyu Li|arXiv (Cornell University)|2023. 03. 15.
Image Retrieval and Classification Techniques인용 수 6
한 줄 요약

FastInst는 경량 아키텍처를 사용하여 COCO test-dev에서 40.5 AP를 기록하면서 실시간 추론(32.5 FPS)을 달성하는 쿼리 기반 인스턴스 세그멘테이션 프레임워크를 제안한다. 이는 무거운 픽셀 디코더와 다수의 Transformer 레이어에 대한 의존도를 줄이기 위해 인스턴스 활성화 유도 쿼리, 이중 경로 업데이트 전략, 지식 기반 마스크 유도 학습을 도입함으로써 고정밀도를 저렴한 추론 지연으로 달성한다.

ABSTRACT

Recent attention in instance segmentation has focused on query-based models. Despite being non-maximum suppression (NMS)-free and end-to-end, the superiority of these models on high-accuracy real-time benchmarks has not been well demonstrated. In this paper, we show the strong potential of query-based models on efficient instance segmentation algorithm designs. We present FastInst, a simple, effective query-based framework for real-time instance segmentation. FastInst can execute at a real-time speed (i.e., 32.5 FPS) while yielding an AP of more than 40 (i.e., 40.5 AP) on COCO test-dev without bells and whistles. Specifically, FastInst follows the meta-architecture of recently introduced Mask2Former. Its key designs include instance activation-guided queries, dual-path update strategy, and ground truth mask-guided learning, which enable us to use lighter pixel decoders, fewer Transformer decoder layers, while achieving better performance. The experiments show that FastInst outperforms most state-of-the-art real-time counterparts, including strong fully convolutional baselines, in both speed and accuracy. Code can be found at https://github.com/junjiehe96/FastInst .

연구 동기 및 목표

  • 쿼리 기반 모델의 효율적 아키텍처 설계 잠재력을 입증함으로써 고정밀도 실시간 인스턴스 세그멘테이션의 격차를 해소한다.
  • 기존 쿼리 기반 모델이 종종 많은 Transformer 디코더 레이어와 무거운 픽셀 디코더를 필요로 하여 비효율적이고 계산 비용이 높은 문제를 해결한다.
  • NMS나 복잡한 후처리에 의존하지 않고 COCO 벤치마크에서 최신 기술 수준의 속도-정확도 성능을 달성한다.
  • 로봇 공학 및 자율 주행과 같은 실세계 응용 분야에 적합한 경량, 종단 간, NMS 없는 인스턴스 세그멘테이션을 가능하게 한다.

제안 방법

  • 특징 맵에서 높은 의미적 잠재력을 지닌 픽셀 임베딩을 동적으로 선택하는 인스턴스 활성화 유도 쿼리를 도입하여, 쿼리 정밀 조정이 필요한 양을 줄인다.
  • Transformer 디코더에서 쿼리 특징과 픽셀 특징을 번갈아가며 업데이트하는 이중 경로 업데이트 전략을 구현하여 특징 표현을 향상시키고 수렴 속도를 가속화한다.
  • 훈련 중 표준 마스크된 어텐션을 고정된 이분 매칭 기반 지식 기반 마스크로 대체하여 지식 기반 마스크 유도 학습을 적용함으로써 각 쿼리가 전체 목표 물체 영역에 주목할 수 있도록 한다.
  • 성능 저하 없이 추론 속도를 향상시키기 위해 사인 함수 기반 위치 임베딩 대신 학습 가능한 위치 임베딩을 사용한다.
  • 더 나은 쿼리와 특징 간 상호작용을 통해 복잡한 모듈(예: MSDeformAttn)에 대한 의존도를 줄임으로써 경량 픽셀 디코더를 설계한다.
  • 정확도와 속도의 균형을 맞추기 위해 쿼리 수와 선택 소스(예: 특징 맵 스케일)를 최적화하며, E4 특징 맵에서 좋은 트레이드오프를 보여준다.

실험 결과

연구 질문

  • RQ1NMS나 무거운 후처리 없이 COCO에서 실시간 추론 속도(≥30 FPS)를 유지하면서도 고정밀도(AP > 40)를 달성할 수 있는 쿼리 기반 인스턴스 세그멘테이션 모델은 가능한가?
  • RQ2쿼리 초기화 과정을 어떻게 개선할 수 있을까? 이를 통해 필요한 Transformer 디코더 레이어 수를 줄이고 수렴 속도를 가속화할 수 있는가?
  • RQ3이중 경로 업데이트 전략은 얼마나 무거운 픽셀 디코더에 대한 의존도를 줄이고 쿼리 기반 모델의 특징 표현을 향상시킬 수 있는가?
  • RQ4지식 기반 마스크 유도 학습은 훈련 중에 전체 물체 영역에 더 효과적으로 주목할 수 있도록 해서 마스크된 어텐션 성능을 향상시킬 수 있는가?
  • RQ5실시간 인스턴스 세그멘테이션에서 속도와 정확도를 균형 잡는 데 최적의 쿼리 유형(IA 유도 vs. 보조)과 특징 맵 스케일 조합은 무엇인가?

주요 결과

  • FastInst는 ResNet-50 백본을 사용하여 COCO test-dev에서 40.5 AP를 기록하면서, 복잡한 보조 기능 없이도 실시간 인스턴스 세그멘테이션 분야에서 새로운 SOTA를 수립한다.
  • 더 빠른 버전을 사용할 경우 53.8 FPS에서 35.6 AP를 달성하여 단일 V100 GPU에서 강력한 속도-정확도 트레이드오프를 보여준다.
  • 단지 6개의 Transformer 디코더 레이어만을 사용해도 30.5 AP를 기록함으로써 성능 포화가 조기에 발생하고, 레이어 수를 줄임으로써 추론 속도 향상이 가능함을 시사한다.
  • 이분 매칭과 위치 비용 손실을 적용한 인스턴스 활성화 유도 쿼리는 배경에서 더 높은 집중도를 보이며 전경 물체에 더 집중된 쿼리 분포를 생성하여 정위치 및 재현율을 향상시킨다.
  • 10개의 IA 유도 쿼리를 추가하면 31.2 AP를 달성하여, 조그만 수의 동적 쿼리라도 강력한 성능을 낼 수 있음을 보여준다.
  • 사인 함수 기반 위치 임베딩을 학습 가능한 것으로 교체함으로써 성능 손실 없이 추론 속도를 향상시켜, 배포 시 효율성 향상의 확증을 얻었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.