Skip to main content
QUICK REVIEW

[논문 리뷰] Video K-Net: A Simple, Strong, and Unified Baseline for Video Segmentation

Xiangtai Li, Wenwei Zhang|arXiv (Cornell University)|2022. 04. 10.
Visual Attention and Saliency Detection인용 수 4
한 줄 요약

Video K-Net는 K-Net에서 유래한 가속 가능한 커널을 활용하여, 종합적인 인스턴스 세분화 및 추적을 동시에 수행하는 단순하고 통합적이며 엔드 투 엔드 프레임워크를 제안한다. 커널 기반의 외관 모델링과 대비 학습을 통한 시간적 상관관계를 도입하여, Cityscapes-VPS, KITTI-STEP, VIPSeg에서 최신 기준 성능을 달성하였으며, KITTI-STEP에서 12%의 상대적 향상과 VIPSeg에서 15%의 상대적 향상을 기록하였다.

ABSTRACT

This paper presents Video K-Net, a simple, strong, and unified framework for fully end-to-end video panoptic segmentation. The method is built upon K-Net, a method that unifies image segmentation via a group of learnable kernels. We observe that these learnable kernels from K-Net, which encode object appearances and contexts, can naturally associate identical instances across video frames. Motivated by this observation, Video K-Net learns to simultaneously segment and track "things" and "stuff" in a video with simple kernel-based appearance modeling and cross-temporal kernel interaction. Despite the simplicity, it achieves state-of-the-art video panoptic segmentation results on Citscapes-VPS, KITTI-STEP, and VIPSeg without bells and whistles. In particular, on KITTI-STEP, the simple method can boost almost 12\% relative improvements over previous methods. On VIPSeg, Video K-Net boosts almost 15\% relative improvements and results in 39.8 % VPQ. We also validate its generalization on video semantic segmentation, where we boost various baselines by 2\% on the VSPW dataset. Moreover, we extend K-Net into clip-level video framework for video instance segmentation, where we obtain 40.5% mAP for ResNet50 backbone and 54.1% mAP for Swin-base on YouTube-2019 validation set. We hope this simple, yet effective method can serve as a new, flexible baseline in unified video segmentation design. Both code and models are released at https://github.com/lxtGH/Video-K-Net.

연구 동기 및 목표

  • 분할과 추적을 위한 별도의 모듈에 의존하는 기존 영상 패노픽 세분화 방법의 복잡한 파이프라인을 단순화하기 위해.
  • 종합적인 'things'와 'stuff' 세분화를 하나의 프레임워크에서 엔드 투 엔드 인스턴스 수준의 추적과 통합하기 위해.
  • RoI 헤드나 추적 쿼리와 같은 보조 구성 요소가 필요 없도록 계산 오버헤드를 줄이기 위해.
  • 커널 수준의 융합과 연관성을 통해 영상 세분화의 시간적 일관성을 향상시키기 위해.
  • 통합된 영상 세분화를 위한 강력하고 단순하며 일반화 가능한 기준 설정을 위해.

제안 방법

  • K-Net에서 유래한 가속 가능한 커널을 활용하여 영상 프레임 전반에 걸쳐 외관과 맥락 인코딩의 내재 표현으로 사용한다.
  • 시간적 추적을 위한 분별성 임베딩을 생성하기 위해 대비 학습 손실을 적용한 커널 연관성 헤드를 도입한다.
  • 특징 수준의 어텐션이나 계층적 모듈을 피하기 위해, 인접 프레임 간 커널 수준에서 커널을 융합하는 시간적 커널 융합 모듈을 적용한다.
  • 학습 중에 커널을 진짜 마스크와 매칭하기 위해 허그리안 할당을 사용하여 강건성 확보 및 불일치한 샘플의 노이즈 감소를 달성한다.
  • 학습된 임베딩 기반으로 커널을 프레임 간에 연결함으로써 온라인 추적을 수행하여 별도의 추적 쿼리나 후처리 NMS의 필요성을 제거한다.
  • 핵심 프레임과 기준 프레임에서의 공동 학습을 통해 커널 그룹화 및 분리 성능 향상으로 일관된 세분화 및 추적을 개선한다.

실험 결과

연구 질문

  • RQ1K-Net와 같은 이미지 세분화 모델에서 유래한 가속 가능한 커널이 추가적인 추적 헤드나 쿼리 없이 엔드 투 엔드 영상 인스턴스 추적을 자연스럽게 지원할 수 있는가?
  • RQ2영상 패노픽 세분화에서 특징 수준 융합과 비교해 커널 수준 융합은 정확도와 효율성 측면에서 어떻게 다른가?
  • RQ3학습 전략—특히 핵심 프레임과 기준 프레임을 함께 사용하는 것—이 커널 연관성 및 세분화 성능에 어떤 영향을 미치는가?
  • RQ4제안된 커널 기반 연관성 방법은 RoI 기반 또는 쿼리 기반 추적과 비교해 정확도와 계산 비용 측면에서 어떻게 다른가?
  • RQ5통합된 커널 기반 프레임워크는 의미적 세분화 및 인스턴스 세분화를 포함한 다양한 영상 세분화 작업에 얼마나 잘 일반화되는가?

주요 결과

  • Video K-Net는 KITTI-STEP에서 12%의 상대적 향상을 기록하며, 더 단순한 파이프라인으로 이전 방법을 크게 능가하였다.
  • VIPSeg에서 이 방법은 39.8%의 VPQ를 기록하여 이전 결과보다 약 15%의 상대적 향상을 달성하였다.
  • KITTI-STEP에서 기준 K-Net 대비 STQ 성능을 3.5% 향상시켰으며, GFLOPs는 2.3% 증가하고 파라미터 수는 1.8% 증가에 그쳤다.
  • 영상 의미 세분화를 위한 VSPW에서, Video K-Net은 다양한 기준 모델을 2% 이상 mIoU 향상시켜 강력한 일반화 능력을 입증하였다.
  • YouTube-2019에서의 영상 인스턴스 세분화에서는 ResNet-50 기반으로 40.5% mAP, Swin-Base 기반으로는 54.1% mAP를 기록하여 대규모 벤치마크에서 뛰어난 성능을 보였다.
  • 절단 실험 결과, 최종 단계에서 커널을 연결하고 학습 중에 매칭된 커널 샘플을 사용할 경우 최고의 성능를 기록함을 확인하였으며, 조기 융합은 성능 저하를 초래함을 밝혔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.