Skip to main content
QUICK REVIEW

[논문 리뷰] Temporally Distributed Networks for Fast Video Semantic Segmentation

Ping Hu, Fabian Caba Heilbron|arXiv (Cornell University)|2020. 04. 03.
Advanced Neural Network Applications참고 문헌 56인용 수 10
한 줄 요약

TDNet은 경량 하위 네트워크를 사용해 순차적 프레임 간에 특징 계산을 시계열적으로 분산시키는 시간 분포 네트워크이다. 이는 운동에 의해 발생하는 오차를 보완하기 위해 주의력 전파 모듈을 사용하고, 그룹화된 지식 증류 손실을 통해 특징 표현을 향상시킨다. Cityscapes, CamVid, NYUD-v2에서 기존 방법보다 2배 이상 낮은 지연 시간을 기록하면서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

We present TDNet, a temporally distributed network designed for fast and accurate video semantic segmentation. We observe that features extracted from a certain high-level layer of a deep CNN can be approximated by composing features extracted from several shallower sub-networks. Leveraging the inherent temporal continuity in videos, we distribute these sub-networks over sequential frames. Therefore, at each time step, we only need to perform a lightweight computation to extract a sub-features group from a single sub-network. The full features used for segmentation are then recomposed by application of a novel attention propagation module that compensates for geometry deformation between frames. A grouped knowledge distillation loss is also introduced to further improve the representation power at both full and sub-feature levels. Experiments on Cityscapes, CamVid, and NYUD-v2 demonstrate that our method achieves state-of-the-art accuracy with significantly faster speed and lower latency.

연구 동기 및 목표

  • 실시간 응용 프로그램에서 딥 러닝 기반 비디오 세그멘테이션의 높은 계산 비용과 지연 시간 문제를 해결하기 위해.
  • 비디오의 시간 연속성을 활용하여 재현 계산을 줄이면서도 높은 정확도를 유지하기 위해.
  • 关键 프레임 기반 방법에서 운동으로 인한 프레임 간 공간적 비일치로 인한 성능 저하 문제를 해결하기 위해.
  • 지식 증류와 분산 하위 네트워크를 통해 경량 모델의 특징 표현을 향상시키기 위해.
  • 기존 비디오 세그멘테이션 방법보다 속도, 정확도, 계산 효율성 간의 더 나은 트레이드오���을 달성하기 위해.

제안 방법

  • 깊은 이미지 세그멘테이션 모델의 고수준 특징을 N개의 얕은 하위 네트워크로 분할하여 각각 다른 특징 그룹을 처리한다.
  • 하위 네트워크를 순환적으로 순차적 프레임에 할당하여, 각 프레임당 하나의 하위 네트워크만 계산되도록 하여 프레임당 계산량을 감소시킨다.
  • 기존의 주의력 전파 모듈을 사용하여 이전 프레임의 하위 특징을 집계하여 각 프레임에서 전체 특징을 재구성하며, 기하학적 변형을 처리한다.
  • 분산 네트워크의 전체 및 하위 특징 수준에 지식 증류 손실을 도입하여 전체 깊이 있는 모델에서 지식을 전달한다.
  • 주의 맵을 스트라이드 n으로 다운샘플링하여 계산량을 줄이고 공간적 맥락을 유지한다.
  • 공유 또는 독립적인 하위 네트워크를 사용하여 특징 다양성과 표현 능력이 성능에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1깊은 비디오 세그멘테이션 모델의 특징 계산을 프레임 간에 분산시켜 정확도를 유지하면서도 프레임당 지연 시간을 줄일 수 있는가?
  • RQ2주의 기반 모듈이 비디오 프레임 간 운동으로 인한 공간적 비일치를 얼마나 효과적으로 보완할 수 있는가?
  • RQ3전체 및 하위 특징 수준에서 지식 증류를 적용할 경우 분산 네트워크의 성능 향상 정도는 어느 정도인가?
  • RQ4공유 네트워크 대신 독립적인 하위 네트워크를 사용할 경우 표현 능력과 세그멘테이션 정확도가 향상되는가?
  • RQ5주의 모듈에서 다운샘플링 스트라이드를 선택할 경우 효율성과 정확도 간의 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • TDNet은 Cityscapes, CamVid, NYUD-v2에서 각각 mIoU 76.8%, 76.5%, 38.2%를 기록하여 기존 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.
  • TD 4 -PSP18 버전은 Cityscapes에서 단 85ms의 지연 시간으로 76.8% mIoU를 달성하여 LadderNet 및 GUNet와 같은 실시간 기준선보다 뚜렷하게 빠르다.
  • 공유 네트워크 대신 독립적인 하위 네트워크를 사용할 경우 계산 비용을 증가시키지 않으면서도 Cityscapes에서 mIoU를 1% 향상시켜 표현 능력 향상을 입증한다.
  • 주의력 전파 모듈은 프레임 간 안정적인 특징 집합을 가능하게 하며, 시각화 결과는 운동이 있음에도 불구하고 시간에 따라 의미 특징을 효과적으로 매칭함을 보여준다.
  • 주의 맵을 스트라이드 n=4로 다운샘플링하면 지연 시간이 35% 감소(268ms → 85ms)하면서 mIoU는 0.1% 감소에 그쳐 강력한 효율성 향상을 입증한다.
  • 제거 실험 결과, 네 개의 하위 특징 경로 중 어느 하나라도 제거할 경우 일관된 정확도 저하가 발생함을 확인하여 분산 특징 계산의 필요성을 증명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.