Skip to main content
QUICK REVIEW

[논문 리뷰] Instance and Panoptic Segmentation Using Conditional Convolutions

Zhi Tian, Bowen Zhang|arXiv (Cornell University)|2021. 02. 05.
Advanced Neural Network Applications참고 문헌 48인용 수 4
한 줄 요약

이 논문은 ROI 기반 특징 추출을 동적이고 인스턴스에 민감한 조건부 컨벌루션으로 대체하는 완전 컨벌루션 아키텍처인 CondInst을 제안한다. 각 인스턴스별로 조건부로 마스크 헤드 필터를 생성함으로써 COCO에서 최신 기준 성능을 달성하면서도 추론 속도가 빠르고 마스크 해상도가 높으며, 더 긴 학습 스케줄이 필요 없이 Mask R-CNN 및 이전 방법보다 빠르고 정확도가 높다.

ABSTRACT

We propose a simple yet effective framework for instance and panoptic segmentation, termed CondInst (conditional convolutions for instance and panoptic segmentation). In the literature, top-performing instance segmentation methods typically follow the paradigm of Mask R-CNN and rely on ROI operations (typically ROIAlign) to attend to each instance. In contrast, we propose to attend to the instances with dynamic conditional convolutions. Instead of using instance-wise ROIs as inputs to the instance mask head of fixed weights, we design dynamic instance-aware mask heads, conditioned on the instances to be predicted. CondInst enjoys three advantages: 1.) Instance and panoptic segmentation are unified into a fully convolutional network, eliminating the need for ROI cropping and feature alignment. 2.) The elimination of the ROI cropping also significantly improves the output instance mask resolution. 3.) Due to the much improved capacity of dynamically-generated conditional convolutions, the mask head can be very compact (e.g., 3 conv. layers, each having only 8 channels), leading to significantly faster inference time per instance and making the overall inference time almost constant, irrelevant to the number of instances. We demonstrate a simpler method that can achieve improved accuracy and inference speed on both instance and panoptic segmentation tasks. On the COCO dataset, we outperform a few state-of-the-art methods. We hope that CondInst can be a strong baseline for instance and panoptic segmentation. Code is available at: https://git.io/AdelaiDet

연구 동기 및 목표

  • ROI 기반 인스턴스 세그멘테이션의 한계, 즉 고정 크기의 특징 추출과 특징 정렬으로 인한 변동하는 추론 시간과 낮은 마스크 해상도를 해결하기 위해.
  • ROI 추출과 ROIAlign이 필요 없는 완전 컨벌루션 아키텍처로 인스턴스 세그멘테이션과 페노틱 세그멘테이션을 통합하기 위해.
  • 각 인스턴스에 맞게 적응하는 컴act하고 동적 필터 생성을 통해 마스크 품질과 추론 효율성을 향상시키기 위해.
  • 조건부 컨벌루션을 사용한 간단한 완전 컨벌루션 설계가 Mask R-CNN와 같은 강력한 이단계 기반 기준 모델보다 정확도와 속도 면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • Mask R-CNN의 고정된 가중치 마스크 헤드를 대체하여, 대상 인스턴스 임베딩에 기반해 조건부로 필터를 생성하는 동적이고 인스턴스에 민감한 마스크 헤드로 변경한다.
  • 마스크 헤드는 인스턴스의 특징 표현에서 유도된 조건 벡터를 사용하여 각 인스턴스의 필터 가중치를 예측하기 위해 경량 백본(예: 3개의 컨벌루션 레이어, 각각 8채널)을 사용한다.
  • 조건부 컨벌루션은 인스턴스의 RoI 특징에 기반해 마스크 헤드 컨벌루션의 커널 가중치를 예측하는 경량 네트워크를 통해 구현되며, 이는 인스턴스별로 특화된 필터링을 가능하게 한다.
  • 이 프레임워크는 완전히 컨벌루션 방식으로 엔드 투 엔드로 작동하며, ROI 추출과 특징 정렬을 제거하고 직접적으로 높은 해상도의 마스크를 각 인스턴스별로 출력한다.
  • 페노틱 세그멘테이션을 위해 동일한 특징 맵에 별도의 세그멘테이션 헤드를 부착하며, 클래스 일관성과 겹침 방지를 위해 인스턴스 마스크를 재가중한다.
  • 표준 인스턴스 세그멘테이션 및 페노틱 세그멘테이션 타겟을 사용하여 학습하며, 마스크 애너테이션은 패널티 레이블링 규칙(예: 겹치는 마스크는 오직 배경 이외의 인스턴스에만 할당)에 맞게 조정된다.

실험 결과

연구 질문

  • RQ1동적이고 인스턴스에 민감한 컨벌루션 필터를 갖춘 완전 컨벌루션 네트워크가 Mask R-CNN와 같은 ROI 기반 방법보다 인스턴스 세그멘테이션 정확도와 추론 속도 면에서 뛰어나게 되는가?
  • RQ2ROI 추출과 특징 정렬을 제거함으로써 인스턴스 세그멘테이션의 마스크 해상도와 모델 효율성에 어떤 영향을 미치는가?
  • RQ3단지 8채널의 컨벌루션만을 사용하는 컴act하고 동적 마스크 헤드가 더 큰 고정 가중치 헤드에 비해 경쟁력 있는 성능을 낼 수 있는가?
  • RQ4조건부 컨벌루션의 사용이 표준 FCN에 비해 더 나은 일반화 능력과 세부 정보 보존 능력을 제공하는가?
  • RQ5동일한 프레임워크가 최소한의 수정만으로 페노틱 세그멘테이션으로 효과적으로 확장되어 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • ResNeXt-101-FPN 백본과 3× 학습 스케줄을 사용하여 COCO test-dev에서 47.8 PQ를 달성하였으며, Panoptic-FPN(46.1 PQ)과 AdaptIS(42.8 PQ)를 모두 뛰어넘었다.
  • Cityscapes val 세트에서 CondInst는 61.7 PQ를 기록하여 Unifying(61.4 PQ)과 Panoptic-FCN(61.4 PQ)을 모두 초월했다.
  • 고정 크기로 리사이징하는 ROI 추출을 피하기 때문에 ROI 기반 방법보다 더 높은 마스크 해상도를 달성한다.
  • 컴act하고 동적 마스크 헤드 아키텍처 덕분에 인스턴스당 추론 시간이 크게 단축되었으며, 인스턴스 수에 따라 변동성이 적다.
  • 더 긴 학습 스케줄이나 복잡한 후처리가 필요 없이 인스턴스 세그멘테이션 및 페노틱 세그멘테이션 벤치마크에서 최신 기준 성능을 달성했다.
  • 정성적 결과에서 CondInst는 YOLACT 및 Mask R-CNN에 비해 더 높은 품질의 마스크를 생성하며 세부 정보를 더 잘 보존하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.