Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Semantic Video Segmentation with Per-frame Inference

Yifan Liu, Chunhua Shen|arXiv (Cornell University)|2020. 02. 26.
Advanced Vision and Imaging참고 문헌 43인용 수 9
한 줄 요약

이 논문은 실시간 의미 영상 분할 방법을 제안하며, 운동 유도 시간 손실과 새로운 시간 지식 정착 전략을 사용하여 훈련 중 시간적 일관성을 강제한다. 이로 인해 프레임별 추론을 통해 소형 모델이 높은 정확도와 부드러운 예측을 달성할 수 있으며, 지연 시간 오버헤드를 제거하고 Cityscapes 및 Camvid 벤치마크에서 关键 프레임 기반 방법을 능가한다.

ABSTRACT

For semantic segmentation, most existing real-time deep models trained with each frame independently may produce inconsistent results for a video sequence. Advanced methods take into considerations the correlations in the video sequence, e.g., by propagating the results to the neighboring frames using optical flow, or extracting the frame representations with other frames, which may lead to inaccurate results or unbalanced latency. In this work, we process efficient semantic video segmentation in a per-frame fashion during the inference process. Different from previous per-frame models, we explicitly consider the temporal consistency among frames as extra constraints during the training process and embed the temporal consistency into the segmentation network. Therefore, in the inference process, we can process each frame independently with no latency, and improve the temporal consistency with no extra computational cost and post-processing. We employ compact models for real-time execution. To narrow the performance gap between compact models and large models, new knowledge distillation methods are designed. Our results outperform previous keyframe based methods with a better trade-off between the accuracy and the inference speed on popular benchmarks, including the Cityscapes and Camvid. The temporal consistency is also improved compared with corresponding baselines which are trained with each frame independently. Code is available at: https://tinyurl.com/segment-video

연구 동기 및 목표

  • 독립적인 프레임 처리로 인한 실시간 의미 영상 분할의 시간적 비일관성 문제를 해결하기 위해.
  • 후처리 또는 다중 프레임 연산에서 발생하는 추론 지연 오버헤드를 제거하기 위해.
  • 속도를 희생시키지 않고도 소형 모델의 영상 분할 성능을 향상시키기 위해.
  • 훈련 시 제약 조건과 지식 정착을 통해 정확도와 시간적 부드러움을 모두 향상시키기 위해.

제안 방법

  • 운동 유도 시간 손실을 도입하여 예측된 광학 흐름을 사용해 한 프레임의 분할 레이블을 다음 프레임로 전파하여 감독한다.
  • 프레임 간의 픽셀 단위 광학 흐름을 예측하는 운동 추정 네트워크를 사용해 레이블 전파를 안내한다.
  • ConvLSTM을 사용해 쌍별 프레임 유사도를 모델링하여 다중 프레임 의존성을 인코딩하는 새로운 시간 지식 정착 방법을 제안한다.
  • 공간 지식 정착과 시간 지식 정착을 융합하여 정확도와 일관성을 모두 향상시킨다.
  • 시간 제약 조건을 적용해 소형 모델(예: MobileNetV2, PSPNet18)을 훈련하지만, 추론은 각 프레임별로 독립적으로 수행한다.
  • 추론 시 계산을 추가하지 않고도 훈련 중에 시간적 일관성을 강제한다.

실험 결과

연구 질문

  • RQ1추론 오버헤드 없이 훈련 중에 시간적 일관성을 효과적으로 강제할 수 있는가?
  • RQ2소형 모델이 영상 분할에서 높은 정확도와 부드러운 예측을 달성할 수 있는가?
  • RQ3시간 지식 정착이 표준 정착 방식을 초월해 정확도와 시간적 부드러움을 동시에 향상시킬 수 있는가?
  • RQ4훈련 시 시간 제약 조건을 적용한 프레임별 추론이 속도와 일관성 면에서 관건 프레임 기반 방법을 능가하는가?

주요 결과

  • 제안된 방법은 기준 모델인 PSPNet18(69.8% mIoU, 68.5% TC)에 비해 Cityscapes에서 더 높은 mIoU(73.1%)와 더 나은 시간적 일관성(70.6%)을 달성했다.
  • Camvid에서 이 방법은 정적 영역(예: 그림 8의 빨간 상자)에서의 깜빡임을 줄여 프레임 간에 안정적인 예측을 생성했다.
  • 향상된 MobileNetV2 모델은 단일 GTX 1080Ti에서 최신의 관건 프레임 기반 방법인 Accel과 DVSN보다 더 빠른 추론 속도와 더 높은 정확도를 확보했다.
  • Cityscapes에서 이동 중인 객체인 'bus'(47.2%에서 48.5%로)와 'train'(55.5%에서 76.4%로)의 시간적 일관성이 크게 향상되었다.
  • Cityscapes에서 'road'에 대해 97.7%의 시간적 일관성 점수와 'sky'에 대해 93.0%를 기록하여 기준 모델을 능가했다.
  • 다양성 분석 결과, 공간 및 시간 정착을 결합할 경우 최고의 성능을 달성했으며, 시간 정착이 일관성 향상에 핵심적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.