[논문 리뷰] Unifying Instance and Panoptic Segmentation with Dynamic Rank-1 Convolutions
이 논문은 동적 랭크-1 컨볼루션(DR1Conv)을 활용하여 고수준의 맥락과 저수준의 세부 정보 특징을 효율적으로 융합하는 통합형, 완전 컨volution형 패노픽 세그멘테이션 프레임워크인 DR1Mask를 제안한다. 이는 단일 추가 분류층만을 추가함으로써 인스턴스 세그멘테이션과 패노픽 세그멘테이션 양쪽에서 최신 기술 수준(SOTA) 성능을 달성한다. ResNet-50 백본을 사용할 때 COCO에서 이전의 이중 브랜치 모델 대비 2배의 추론 속도 향상을 이룬다. 또한 패노픽 품질(PQ)은 8포인트 향상된다.
Recently, fully-convolutional one-stage networks have shown superior performance comparing to two-stage frameworks for instance segmentation as typically they can generate higher-quality mask predictions with less computation. In addition, their simple design opens up new opportunities for joint multi-task learning. In this paper, we demonstrate that adding a single classification layer for semantic segmentation, fully-convolutional instance segmentation networks can achieve state-of-the-art panoptic segmentation quality. This is made possible by our novel dynamic rank-1 convolution (DR1Conv), a novel dynamic module that can efficiently merge high-level context information with low-level detailed features which is beneficial for both semantic and instance segmentation. Importantly, the proposed new method, termed DR1Mask, can perform panoptic segmentation by adding a single layer. To our knowledge, DR1Mask is the first panoptic segmentation framework that exploits a shared feature map for both instance and semantic segmentation by considering both efficacy and efficiency. Not only our framework is much more efficient -- twice as fast as previous best two-branch approaches, but also the unified framework opens up opportunities for using the same context module to improve the performance for both tasks. As a byproduct, when performing instance segmentation alone, DR1Mask is 10% faster and 1 point in mAP more accurate than previous state-of-the-art instance segmentation network BlendMask. Code is available at: https://git.io/AdelaiDet
연구 동기 및 목표
- 인스턴스 세그멘테이션과 패노픽 세그멘테이션을 하나의 효율적이고 완전 컨볼루션 기반 프레임워크로 통합하여 작업 간 공유되는 특징을 활용한다.
- 기존의 이중 브랜치 패노픽 모델에서의 비효율성과 특징 공유 부족 문제, 특히 의미 세그멘테이션 헤드 설계에서의 문제를 해결한다.
- 매개변수 및 계산 비용이 증가하지 않더라도 고차원 특징 맵에서도 효율적인 특징 융합 메커니즘을 개발한다.
- 최소한의 추론 비용으로 고해상도 마스크 예측을 가능하게 하되, 정확도는 유지하거나 향상시킨다.
- 통합 아키텍처가 패노픽 세그멘테이션에서 별도의 모델보다 빠르고 정확도가 높다는 것을 입증한다.
제안 방법
- 고수준과 저수준 특징 간의 이차 특징 상호작용을 저랭크 근사법을 사용하여 계산하는 동적 랭크-1 컨볼루션(DR1Conv) 모듈을 도입한다.
- 중간 레이어에 DR1Conv를 적용하여 맥락과 세부 정보 특징을 융합함으로써 인스턴스 및 의미 세그멘테이션에 대한 개선된 특징 표현을 가능하게 한다.
- 단일 추가 분류층이 의미 세그멘테이션 출력을 생성하는 통합 네트워크 헤드를 설계하여 별도의 'stuff' 브랜치가 필요 없도록 한다.
- 텐서 분해를 활용해 인스턴스 예측 헤드를 압축함으로써 거의 계산 비용 없이 mAP를 1% 향상시킨다.
- 인스턴스 및 의미 헤드 간에 공통된 특징 맵을 사용함으로써 중복을 줄이고 공동 최적화를 가능하게 한다.
- 3배 스케줄과 다중 해상도 증강을 사용하여 훈련하고, 공정한 비교를 위해 동일한 조건에서 추론 시간을 측정한다.
실험 결과
연구 질문
- RQ1통합형, 완전 컨볼루션 아키텍처가 최소한의 계산 오버헤드로 인스턴스 및 패노픽 세그멘테이션 양쪽에서 최신 기술 수준 성능을 달성할 수 있는가?
- RQ2동적 랭크-1 컨볼루션은 매개변수나 계산 비용을 증가시키지 않으면서도 다중 작업 간에 고수준 맥락과 저수준 세부 정보 특징을 효과적으로 융합할 수 있는가?
- RQ3인스턴스 세그멘테이션 네트워크에 단일 의미 헤드를 추가하면 빠른 추론 속도를 유지하면서도 경쟁 가능한 의미 세그멘테이션 성능을 달성할 수 있는가?
- RQ4기저 특징 차원 수의 선택이 통합된 의미 및 인스턴스 세그멘테이션 헤드 성능에 어떤 영향을 미치는가?
- RQ5위치 민감한 어텐션은 왜 패노픽 세그멘테이션 성능을 떨어뜨리는가? 그리고 이러한 문제를 통합 아키텍처에서 어떻게 완화할 수 있는가?
주요 결과
- DR1Mask는 ResNet-50를 사용할 때 COCO 인스턴스 세그멘테이션(test-dev)에서 44.5 mAP를 기록하며, 79ms의 추론 시간에 그치지만 BlendMask보다 1포인트 mAP 높고 10% 더 빠르게 작동한다.
- 패노픽 세그멘테이션에서 DR1Mask는 COCO val2017에서 42.9 PQ를 기록하며, Panoptic-DeepLab보다 8 PQ 포인트 높고, 두 배 빠른 속도로 작동한다.
- 이전 최고 성능을 낸 이중 브랜치 모델인 Panoptic-DeepLab 대비 DR1Mask는 추론 시간을 50% 감소시키며 PQ를 8포인트 향상시켰다.
- 기저 특징 차원을 32에서 64로 두 배로 늘리면 의미 세그멘테이션 품질이 2.1포인트 향상되어 채널 너비가 클래스 구분에 있어 중요함을 시사한다.
- 위치 민감한 어텐션은 의미 세그멘테이션 성능을 2.6포인트 떨어뜨리며, 이는 이러한 메커니즘이 통합 패노픽 학습에 최적화되어 있지 않음을 나타낸다.
- 제안된 텐서 분해 기반 헤드는 거의 계산 비용 없이 mAP를 1% 향상시키며, 인스턴스 예측에서의 효율성 향상을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.