Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Training and Inference for Panoptic Segmentation

Qizhu Li, Xiaojuan Qi|arXiv (Cornell University)|2020. 01. 14.
Advanced Neural Network Applications참고 문헌 20인용 수 6
한 줄 요약

이 논문은 학습과 추론을 통합하기 위해 학습 가능한 경량 인스턴스 유사도 모듈과 미분 가능 패노픽 헤드를 사용하는 엔드 투 엔드 패노픽 세그멘테이션 프레임워크를 제안한다. 이로 인해 히우리스틱 후처리가 제거되며, ResNet-50와 경계 상자 정보만을 사용함으로써 Cityscapes에서 61.4 PQ, COCO에서 43.4 PQ의 최고 성능을 달성하여 국소화 오차에 대한 강건성과 네트워크 설계의 유연성을 입증한다.

ABSTRACT

We present an end-to-end network to bridge the gap between training and inference pipeline for panoptic segmentation, a task that seeks to partition an image into semantic regions for "stuff" and object instances for "things". In contrast to recent works, our network exploits a parametrised, yet lightweight panoptic segmentation submodule, powered by an end-to-end learnt dense instance affinity, to capture the probability that any pair of pixels belong to the same instance. This panoptic submodule gives rise to a novel propagation mechanism for panoptic logits and enables the network to output a coherent panoptic segmentation map for both "stuff" and "thing" classes, without any post-processing. Reaping the benefits of end-to-end training, our full system sets new records on the popular street scene dataset, Cityscapes, achieving 61.4 PQ with a ResNet-50 backbone using only the fine annotations. On the challenging COCO dataset, our ResNet-50-based network also delivers state-of-the-art accuracy of 43.4 PQ. Moreover, our network flexibly works with and without object mask cues, performing competitively under both settings, which is of interest for applications with computation budgets.

연구 동기 및 목표

  • 히우리스틱 후처리를 제거하여 패노픽 세그멘테이션에서 학습과 추론 간 격차를 해소하기 위해.
  • 정신적 및 인스턴스 세그멘테이션을 통합하는 미분 가능 패노픽 헤드를 통해 엔드 투 엔드 최적화를 가능하게 하기 위해.
  • 데이터 기반의 인스턴스 유사도 학습을 통해 국소화 오차(예: 경계 상자)에 대한 강건성을 향상시키기 위해.
  • 전체 패노픽 품질(PQ)을 직접 최적화하기 위한 새로운 패노픽 매칭 손실을 설계하기 위해.
  • 지식 기반 인스턴스 마스크가 필요 없이도 높은 성능을 달성하여 계산 자원이 제한된 환경에서의 설계의 유연성을 확보하기 위해.

제안 방법

  • 픽셀 간 밀도적 쌍별 인스턴스 유사도를 예측하는 매개변수화된 경량 패노픽 세그멘테이션 서브모듈을 도입한다.
  • 예측된 유사도 기반으로 이미지 전반에 걸쳐 패노픽 로짓을 미분 가능하게 통합하는 프로파게이션 메커니즘을 사용하여 엔드 투 엔드 학습 및 추론을 가능하게 한다.
  • 고정된 헤드 수가 없는 변수 수의 패노픽 인스턴스를 표현하기 위해 동적 퍼텐셜 헤드를 활용한다.
  • 예측된 패노픽 세그멘테이션에 대해 온라인 인스턴스 매칭을 수행한 후에 직접 교차 엔트로피 손실을 계산하는 패노픽 매칭 손실을 제안한다.
  • 예측된 유사도를 활용해 경계 상자와 같은 굵은 국소화 신호로부터 불완전한 예측(예: 잘린 객체)을 보정한다.
  • 후처리가 필요 없이 경계 상자 또는 마스크 애너테이션만을 사용하여 전체 시스템을 엔드 투 엔드로 학습한다.

실험 결과

연구 질문

  • RQ1히우리스틱 후처리 없이도, 미분 가능하고 학습 가능한 인스턴스 유사도 메커니즘이 패노픽 세그멘테이션에서 학습과 추론을 통합할 수 있는가?
  • RQ2새로운 패노픽 매칭 손실을 사용한 엔드 투 엔드 학습이 지식 기반 검출기로 학습하는 것보다 성능을 향상시키는가?
  • RQ3국소화 신호(예: 경계 상자)가 부정확하거나 불완전할 경우, 모델이 전체 인스턴스 세그먼테이션을 얼마나 잘 복구할 수 있는가?
  • RQ4비용이 많이 드는 지식 기반 인스턴스 마스크에 의존하지 않고도 최고 성능을 달성할 수 있는가?
  • RQ5제안된 방법은 정신적 세그멘테이션과 인스턴스 세그멘테이션 예측 간의 일관성 문제를 어떻게 다루는가?

주요 결과

  • 모델은 ResNet-50 기반으로 도메인 특화 애너테이션만을 사용하여 Cityscapes에서 61.4 PQ를 달성하며, 이는 이 설정에서 새로운 SoTA 기록이다.
  • COCO 데이터셋에서 ResNet-50 기반 모델은 43.4 PQ를 기록하여 새로운 SoTA 성능을 확립한다.
  • 객체 마스크 신호가 없어도 경쟁력 있는 성능를 보이며, 굵은 국소화 입력에 대한 강건성을 입증한다.
  • 정성적 결과는 고유사도 픽셀을 통해 정보를 전파함으로써 히우리스틱 방법이 빈 공간을 남기는 것과는 달리, 잘린 객체(예: 자동차)를 성공적으로 복구함을 보여준다.
  • 제거 분석 결과, 유사도 모듈을 통해 예측된 검출기를 사용한 학습이 지식 기반 검출기로 학습하는 것보다 더 높은 성능를 내며, 엔드 투 엔드 학습의 가치를 입증한다.
  • 패노픽 매칭 손실은 PQ를 직접 최적화할 수 있게 하고, 미분 가능한 패노픽 헤드 덕분에 테스트 시 후처리 없이도 전체 엔드 투 엔드 학습이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.