Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Instance Activation for Real-Time Instance Segmentation

Tianheng Cheng, Xinggang Wang|arXiv (Cornell University)|2022. 03. 24.
Advanced Image and Video Retrieval Techniques인용 수 10
한 줄 요약

이 논문은 기존의 바운딩 박스나 밀도 중심 기반 예측에 의존하지 않고, 분류 가능한 객체 영역을 강조하는 희소 인스턴스 활성화 맵(Sparse Instance Activation Maps, IAMs)을 사용하는 실시간 인스턴스 세분화 프레임워크인 SparseInst를 제안한다. 이중 매칭을 통한 엔드 투 엔드 학습과 NMS(비최대 억제)를 회피함으로써, COCO에서 37.9 mask AP를 기록하면서도 40 FPS의 추론 속도를 달성하여 이전 방법들에 비해 속도와 정확도 면에서 모두 뛰어나다.

ABSTRACT

In this paper, we propose a conceptually novel, efficient, and fully convolutional framework for real-time instance segmentation. Previously, most instance segmentation methods heavily rely on object detection and perform mask prediction based on bounding boxes or dense centers. In contrast, we propose a sparse set of instance activation maps, as a new object representation, to highlight informative regions for each foreground object. Then instance-level features are obtained by aggregating features according to the highlighted regions for recognition and segmentation. Moreover, based on bipartite matching, the instance activation maps can predict objects in a one-to-one style, thus avoiding non-maximum suppression (NMS) in post-processing. Owing to the simple yet effective designs with instance activation maps, SparseInst has extremely fast inference speed and achieves 40 FPS and 37.9 AP on the COCO benchmark, which significantly outperforms the counterparts in terms of speed and accuracy. Code and models are available at https://github.com/hustvl/SparseInst.

연구 동기 및 목표

  • 밀도 있는 예측과 후처리에 의존하는 기존 실시간 인스턴스 세분화 방법의 비효율성과 높은 지연 문제를 해결하기 위해.
  • 비최대 억제(NMS)를 피하고 계산 오버헤드를 줄이는 완전 컨볼루션형 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 영역 또는 중심 기반 표현 대신 정보성 있고 인스턴스 인식 가능한 영역을 강조하는 희소 활성화 맵을 통해 특징 집약을 향상시키기 위해.
  • 자율 주행 및 로봇과 같은 실시간 응용 분야에서 우수한 속도-정확도 트레이드오프를 달성하기 위해.

제안 방법

  • 특징 공간 내에서 분류 가능한 인스턴스 인식 영역을 강조하는 새로운 객체 표현으로 인스턴스 활성화 맵(IAMs)을 제안한다.
  • 특징 맵에서 IAMs를 생성하기 위해 $3\times3$ 컨볼루션 레이어를 사용하여 국소적 맥락 인식과 공간적 정렬을 가능하게 한다.
  • 학습 중에 진짜 인스턴스를 예측에 할당하기 위해 희생자 알고리즘(Hungarian algorithm)을 활용한 이분 매칭을 적용하여 NMS 없이도 엔드 투 엔드 학습이 가능하도록 한다.
  • 계산 비용과 지연을 줄이기 위해 단일 수준의 특징 예측 헤드를 사용한다.
  • RoI-Align이나 영역 기반 연산을 피하기 위해, IAMs에서 직접적으로 인스턴스 특징과 세분화 마스크를 생성하는 완전 컨볼루션 디코더를 설계한다.
  • 정렬과 NMS를 제거한 경량 후처리 파이프라인을 도입하여 추론 시간을 크게 단축시킨다.

실험 결과

연구 질문

  • RQ1희소하고 인스턴스 인식 가능한 활성화 맵 표현이 실시간 인스턴스 세분화에서 밀도 중심 또는 영역 기반 표현보다 뛰어나게 성능을 낼 수 있는가?
  • RQ2앵커나 중심점과 같은 수작업으로 만든 공간 사전 지식에 의존하지 않고, IAMs를 효과적으로 엔드 투 엔드로 학습할 수 있는가?
  • RQ3이중 매칭을 통해 IAMs를 학습시켜 중복 예측을 억제하고 NMS가 필요 없도록 만들 수 있는가?
  • RQ41×1 컨볼루션 또는 쿼리 기반 어텐션에 비해, IAM 생성에 $3\times3$ 컨볼루션을 사용할 경우 특징 품질은 얼마나 향상되는가?
  • RQ5다중 수준 기반 검출기 대비 단일 수준의 완전 컨볼루션 프레임워크를 사용한 IAM 기반 방법의 속도-정확도 트레이드오프는 어떠한가?

주요 결과

  • SparseInst는 단일 NVIDIA 2080Ti GPU에서 COCO test-dev 세트에서 37.9 mask AP를 기록하면서도 40.0 FPS의 추론 속도를 달성하여, 이전의 실시간 방법들보다 속도와 정확도 면에서 뚜렷이 뛰어나다.
  • 입력 해상도를 $448\times448$로 설정했을 때, 58.5 FPS에 도달하면서도 경쟁 가능한 정확도를 유지하여, 더 작은 입력에 대해서도 높은 효율성을 보여준다.
  • 이중 매칭을 통한 레이블 할당은 NMS 없이도 엔드 투 엔드 학습이 가능하게 하여, 후처리 시간을 총 추론 시간의 약 10% 감소시켰다.
  • 시각화 결과 IAMs가 다양한 스케일, 가림, 자세 변화 상황에서도 일관되게 분류 가능한 객체 부분을 강조함을 보여주어 강력한 인스턴스 정렬 능력을 입증한다.
  • IAMs를 4헤드 크로스 어텐션 또는 100개의 쿼리로 대체했을 때, AP가 0.2에서 0.9 하락함으로써 $3\times3$ 컨볼루션 기반 IAM 설계의 우수성을 확인한다.
  • 혼잡한 장면에 대해서도 잘 일반화되어 있으며, 높은 인스턴스 밀도 조건에서도 정밀한 경계를 가진 정확한 세분화 마스크를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.