Skip to main content
QUICK REVIEW

[논문 리뷰] Low-Latency Video Semantic Segmentation

Yule Li, Jianping Shi|ArXiv.org|2018. 04. 02.
Visual Attention and Saliency Detection참고 문헌 25인용 수 3
한 줄 요약

이 논문은 공간적으로 변형된 컨볼루션을 통한 적응형 특징 전파와 关键 프레임 선택을 위한 적응형 스케줄러를 활용한 저지연 영상 의미 분할 프레임워크를 제안한다. 정확도 예측에 기반해 계산을 동적으로 할당하고 프레임 간에 특징을 효율적으로 재사용함으로써, Cityscapes에서 지연 시간을 119ms로 줄였으며 이는 기준값의 33%에 해당한다. 이와 동시에 최신 기술 수준의 성능을 달성하면서 정확도와 효율성이 향상되었다.

ABSTRACT

Recent years have seen remarkable progress in semantic segmentation. Yet, it remains a challenging task to apply segmentation techniques to video-based applications. Specifically, the high throughput of video streams, the sheer cost of running fully convolutional networks, together with the low-latency requirements in many real-world applications, e.g. autonomous driving, present a significant challenge to the design of the video segmentation framework. To tackle this combined challenge, we develop a framework for video semantic segmentation, which incorporates two novel components: (1) a feature propagation module that adaptively fuses features over time via spatially variant convolution, thus reducing the cost of per-frame computation; and (2) an adaptive scheduler that dynamically allocate computation based on accuracy prediction. Both components work together to ensure low latency while maintaining high segmentation quality. On both Cityscapes and CamVid, the proposed framework obtained competitive performance compared to the state of the art, while substantially reducing the latency, from 360 ms to 119 ms.

연구 동기 및 목표

  • 자율주행과 같은 실시간 응용 분야에서 저지연 영상 의미 분할의 과제를 해결하기 위해.
  • 기존 방법들이 평균 비용은 줄이지만 최대 지연 시간은 줄이지 못하는 한계를 극복하기 위해.
  • 균일하게가 아니라 공간적으로 적응형으로 전파 가중치를 조정함으로써 프레임 간 특징 재사용을 향상시키기 위해.
  • 정확도를 훼손하지 않으면서도 계산을 줄이는 동적 키프레임 스케줄링 메커니즘을 설계하기 위해.
  • 이전 방법들보다 추론 지연 시간과 의미 분할 정확도 사이의 균형을 더 잘 달성하기 위해.

제안 방법

  • 위치 기반 가중치를 사용해 이전 프레임의 특징을 적응적으로 융합하는 공간적으로 변형된 컨볼루션 기반의 특징 전파 모듈을 도입한다.
  • 정확도 예측을 수행하고 필요할 경우에만 키프레임 계산을 트리거하는 적응형 스케줄러를 활용한다.
  • 빠른 추론을 위한 하부와 정확한 특징 추출을 위한 상부로 구성된 이중 분기 네트워크 아키텍처를 사용한다.
  • 키프레임 계산과 특징 전파를 병렬 처리하여 유휴 시간을 최소화한다.
  • 엔드 투 엔드 학습 가능한 프레임워크에 적응형 전파 및 스케줄링 모듈을 통합하여 온라인 영상 분할을 구현한다.
  • 동적 스케줄링 결정을 안내하기 위해 중간 특징 맵을 활용해 정확도를 예측한다.

실험 결과

연구 질문

  • RQ1공간적으로 변형된 컨볼루션을 활용한 적응형 특징 전파가 영상 스트림에서 계산량을 줄이고 정확도를 향상시킬 수 있는가?
  • RQ2동적 키프레임 스케줄링 전략이 성능 저하 없이 최대 지연 시간을 줄일 수 있는가?
  • RQ3기준 데이터셋에서 제안된 프레임워크는 지연 시간과 mIoU 측면에서 최신 기술 수준의 방법들과 비교해 어떻게 성과를 내는가?
  • RQ4적응형 스케줄러는 높은 정확도를 유지하면서 얼마나 많은 키프레임 수를 줄일 수 있는가?
  • RQ5적응형 전파와 스케줄링의 조합이 복잡하고 동적인 환경에서 실시간 성능을 가능하게 하는가?

주요 결과

  • 제안된 프레임워크는 Cityscapes 데이터셋에서 추론 지연 시간을 119ms로 줄였으며, 기준값 360ms 대비 67% 감소한 것이다.
  • Cityscapes에서 평균 교차율(mIoU)은 82.9%를 기록하여 이전 최신 기술 수준의 방법들을 능가했다.
  • CamVid 데이터셋에서 픽셀 정확도는 94.6%, 클래스 정확도는 82.9%를 기록했으며, 비교된 방법들 중에서 가장 높은 성능이었다.
  • 모든 키프레임 간격에서 고정 빈도 및 임계값 기반 스케줄링 대비 적응형 스케줄러가 일관되게 우수한 성능을 보였으며, 제한된 계산 자원에서도 정확도를 향상시켰다.
  • 지연 시간 분석 결과, 적응형 전파와 스케줄링 모듈이 총 지연 시간의 각각 10.5%와 5.5%에 불과하여 매우 높은 효율성을 보였다.
  • Cityscapes 및 CamVid에서의 시각적 결과는 특히 동적인 또는 복잡한 장면에서 경계 및 텍스처 세부 정보에서 뚜렷한 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.