[논문 리뷰] Mask Propagation for Efficient Video Semantic Segmentation
이 논문은 효율적인 비디오 세그멘테이션을 위한 새로운 마스크 전파 프레임워크인 MPVSS를 제안한다. 이는 희박한 키 프레임에서 쿼리 기반 이미지 세그멘테이션을 활용하고, 정확하고 효율적인 마스크 왜곡을 위해 세그먼트 인식형 플로 웨이트를 학습한다. 이 방법은 VSPW에서 FLOPs의 26%만을 사용하면서도 SOTA 모델인 MRCFA보다 4.0% 높은 mIoU 성능을 달성하며, 프레임 단위 기반 기준 대비 최대 4배의 FLOPs 절감을 이룬다. 이는 정확도 저하가 최소한이면서도 최고의 정확도-효율성 균형을 확보한다.
Video Semantic Segmentation (VSS) involves assigning a semantic label to each pixel in a video sequence. Prior work in this field has demonstrated promising results by extending image semantic segmentation models to exploit temporal relationships across video frames; however, these approaches often incur significant computational costs. In this paper, we propose an efficient mask propagation framework for VSS, called MPVSS. Our approach first employs a strong query-based image segmentor on sparse key frames to generate accurate binary masks and class predictions. We then design a flow estimation module utilizing the learned queries to generate a set of segment-aware flow maps, each associated with a mask prediction from the key frame. Finally, the mask-flow pairs are warped to serve as the mask predictions for the non-key frames. By reusing predictions from key frames, we circumvent the need to process a large volume of video frames individually with resource-intensive segmentors, alleviating temporal redundancy and significantly reducing computational costs. Extensive experiments on VSPW and Cityscapes demonstrate that our mask propagation framework achieves SOTA accuracy and efficiency trade-offs. For instance, our best model with Swin-L backbone outperforms the SOTA MRCFA using MiT-B5 by 4.0% mIoU, requiring only 26% FLOPs on the VSPW dataset. Moreover, our framework reduces up to 4x FLOPs compared to the per-frame Mask2Former baseline with only up to 2% mIoU degradation on the Cityscapes validation set. Code is available at https://github.com/ziplab/MPVSS.
연구 동기 및 목표
- 비디오 세그멘테이션(VSS)에서 강력한 이미지 세그멘테이터가 모든 비디오 프레임을 처리하는 데 드는 높은 계산 비용을 해결하기 위해.
- 희박한 키 프레임에서의 정확한 마스크 예측을 재사용하여 비디오 처리의 시간적 중복을 줄이기 위해.
- 픽셀 수준의 옵티컬 플로우에 의존하는 것 대신 세그먼트 수준의 정보를 통합함으로써 마스크 왜곡을 위한 플로우 추정을 향상시키기 위해.
- 카테고리 일致성 손실 없이 VSS에서 뛰어난 정확도-효율성 균형을 달성하기 위해.
제안 방법
- 정확한 이진 마스크 및 클래스 예측을 생성하기 위해 강력한 쿼리 기반 이미지 세그멘테이터(예: Mask2Former)를 희박한 키 프레임에만 적용한다.
- 쿼리 기반 플로우 추정 모듈을 제안하며, 각 키 프레임의 쿼리는 해당 마스크에 대응하는 세그먼트 인식형 플로우 맵을 생성한다.
- 키 프레임의 동일한 쿼리 임bedding을 사용하여 플로우 맵을 학습함으로써, 각 세그먼트별로 운동 특징을 추출하고 플로우 정확도를 향상시킨다.
- 예측된 쿼리 기반 플로우 맵을 사용하여 키 프레임의 마스크 예측을 비키 프레임으로 왜곡함으로써, 프레임 단위 추론을 대체한다.
- 보정 단계를 통해 세그먼트 수준의 운동 신호를 이용하여 픽셀 수준의 플로우를 향상시켜, 더 나은 왜곡 품질을 확보한다.
- 유연한 키 프레임 간격을 지원함으로써 정확도와 계산 비용 사이의 동적 균형 조정이 가능하다.
![Figure 1 : Motivation of the proposed MPVSS. Three consecutive frames with ground truth category labels are sampled from a video in VSPW [ 42 ] , illustrating a strong correlation between video frames along the temporal dimension. This observation underscores the significant temporal redundancy pres](https://ar5iv.labs.arxiv.org/html/2310.18954/assets/x1.png)
실험 결과
연구 질문
- RQ1기존 옵티컬 플로우 대비 세그먼트 인식형 플로우 추정이 비디오 세그멘테이션에서 마스크 전파 정확도를 향상시킬 수 있는가?
- RQ2키 프레임에서의 마스크 예측 재사용이 비디오 세그멘테이션의 효율성과 정확도에 어떤 영향을 미치는가?
- RQ3쿼리 기반 플로우 학습은 얼마나 높은 mIoU 성능을 유지하면서도 계산 비용을 줄일 수 있는가?
- RQ4정확도 저하 측면에서 키 프레임 간격 증가에 대해 제안된 방법의 견고성은 어느 정도인가?
주요 결과
- VSPW 데이터셋에서 Swin-L 백본을 사용한 MPVSS는 SOTA인 MRCFA보다 4.0% 높은 mIoU 성능을 보였으며, FLOPs는 26%에 불과했다.
- Cityscapes 검증 세트에서 프레임 단위 Mask2Former 기준 대비 MPVSS는 FLOPs를 최대 4배 감소시켰고, mIoU 저하도 2%에 그쳤다.
- 제안된 쿼리 기반 플로우는 기존 옵티컬 플로우보다 일관되게 뛰어난 성능을 보였으며, 특히 장거리 시간적 전파에서 유의미한 성능 향상을 보였다. 키 프레임 간격이 10일 때 mIoU 저하가 1.1%에 그친 데 반해, 옵티컬 플로우는 2.63%의 저하를 보였다.
- 랜덤 초기화 대비 학습된 쿼리를 사용한 플로우 추정은 Swin-T와 Swin-B에서 각각 1.1%와 1.5%의 mIoU 향상을 이뤘다.
- Query-for-PF 변형은 옵티컬 플로우 대비 각각 0.1%와 0.2%의 성능 향상을 보이며, 플로우 학습에서 세그먼트 수준 정보의 유용성을 입증했다.
- 정성적 결과 분석에서 MPVSS는 프레임 단위 기반 기준 및 옵티컬 플로우 기반 방법보다 더 뛰어난 카테고리 일치성과 더 정확한 소형 이동 물체 추적 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.