Skip to main content
QUICK REVIEW

[논문 리뷰] AdaScale: Towards Real-time Video Object Detection Using Adaptive Scaling

Ting-Wu Chin, Ruizhou Ding|arXiv (Cornell University)|2019. 02. 08.
Advanced Image and Video Retrieval Techniques참고 문헌 23인용 수 39
한 줄 요약

AdaScale은 각 비디오 프레임마다 입력 이미지 스케일을 적응적으로 선택하여 비디오 객체 탐지의 속도와 정확도를 모두 향상시키며, ImageNet VID와 mini YouTube-BB 데이터셋에서 속도 향상과 함께 주목할 만한 mAP 향상을 달성합니다.

ABSTRACT

In vision-enabled autonomous systems such as robots and autonomous cars, video object detection plays a crucial role, and both its speed and accuracy are important factors to provide reliable operation. The key insight we show in this paper is that speed and accuracy are not necessarily a trade-off when it comes to image scaling. Our results show that re-scaling the image to a lower resolution will sometimes produce better accuracy. Based on this observation, we propose a novel approach, dubbed AdaScale, which adaptively selects the input image scale that improves both accuracy and speed for video object detection. To this end, our results on ImageNet VID and mini YouTube-BoundingBoxes datasets demonstrate 1.3 points and 2.7 points mAP improvement with 1.6x and 1.8x speedup, respectively. Additionally, we improve state-of-the-art video acceleration work by an extra 1.25x speedup with slightly better mAP on ImageNet VID dataset.

연구 동기 및 목표

  • 자율 시스템을 위한 더 빠르고 더 정확한 비디오 객체 탐지를 촉진한다.
  • 스피드뿐만 아니라 탐지 정확도를 향상시키기 위해 다운샘플링이 가능한지 조사한다.
  • 프레임마다 최적의 입력 스케일을 예측하는 적응형 스케일 메커니즘을 개발한다.
  • ImageNet VID 및 YouTube-BB 데이터셋에서 개선을 입증하고 기존 비디오 가속 방법과의 호환성을 보여준다.

제안 방법

  • 입력 스케일 S의 유한 집합과 이미지별 탐지 손실에 기반한 지표를 정의하여 각 이미지에 대해 최적 스케일 m_opt를 선택한다.
  • 딥 CNN 특징을 입력으로 받아 다음 프레임의 입력 스케일을 얼마나 조정할지 나타내는 상대 스케일 t를 [-1, 1] 범위로 출력하는 스케일 회귀기를 학습한다.
  • 손실 L_scalereg(평균 제곱 오차)를 사용하여 회귀기를 이미지별 손실 지표에서 파생된 실제 최적 스케일(Ground-truth)과 비교하여 학습한다.
  • 연속 프레임이 유사한 최적 스케일을 가지는 시간적 일관성을 활용한다.
  • 검증 시 간단한 디코딩 단계로 회귀된 스케일을 S 내의 실제 이미지 스케일로 매핑하는 AdaScale을 적용한다.
  • 필요시 AdaScale을 기존의 비디오 가속 방법과 결합하여 속도를 추가로 향상시킨다.
  • 학습은 여러 스케일에 걸친 R-FCN 기반 탐지기의 다중 스케일 미세조정과 함께 이루어지며, 회귀기 가중치는 탐지기를 고정한 채 학습된다.

실험 결과

연구 질문

  • RQ1적응형 이미지 스케일링이 기존의 고정 스케일 테스트를 넘어 비디오 객체 탐지기의 속도와 정확도 모두를 향상시킬 수 있는가?
  • RQ2추론 시 다운샘플링이 비디오 객체 탐지기의 FP를 줄이고 TP를 증가시키는 데 도움이 되는가?
  • RQ3현재 프레임 콘텐츠를 바탕으로 학습된 회귀기가 다음 비디오 프레임의 최적 스케일을 얼마나 효과적으로 예측할 수 있는가?
  • RQ4AdaScale이 다른 비디오 가속 기법과 보완적으로 작용하여 더 나은 속도-정확도 파레토 프런티어를 달성할 수 있는가?

주요 결과

  • AdaScale은 ImageNet VID에서 1.6x 속도향상(MS/AdaScale vs SS/SS)으로 1.3 포인트의 mAP 향상을 제공합니다.
  • AdaScale은 mini YouTube-BB에서 1.8x 속도향상으로 2.7 포인트의 mAP 향상을 제공합니다.
  • 최신 영상 가속과 AdaScale의 결합은 ImageNet VID에서 추가로 약 25%의 속도 향상을 제공하되 mAP은 약간 증가할 수 있습니다.
  • 스케일 회귀기는 약 2 ms의 오버헤드를 추가합니다(약 R-FCN 런타임의 3%).
  • 적응형 스케일링은 거짓 양성(false positives)을 줄이고 고정 스케일 비교대비 recall의 큰 변화 없이 정밀도를 높일 수 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.