Skip to main content
QUICK REVIEW

[논문 리뷰] SALISA: Saliency-based Input Sampling for Efficient Video Object Detection

Babak Ehteshami Bejnordi, Amirhossein Habibian|arXiv (Cornell University)|2022. 04. 05.
Visual Attention and Saliency Detection인용 수 4
한 줄 요약

SALISA는 고해상도 비디오 프레임을 효율적으로 다운샘플링하면서도 주목할 만한 영역의 세밀한 세부 정보를 유지하는, 주목도 기반의 비균일 입력 샘플링 방법을 제안한다. 이는 미분 가능한 얇은 판 스퍼링 공간 변환 네트워크(Thick Plate Spline Spatial Transformer Network)를 사용하여 구현되며, 이로 인해 계산 비용을 크게 줄이면서도 SOTA 수준의 검출 성능을 달성한다. ImageNet-VID 및 UA-DETRAC에서 EfficientDet-D1 백본을 사용함으로써 EfficientDet-D2 수준의 mAP 성능을 달성한다.

ABSTRACT

High-resolution images are widely adopted for high-performance object detection in videos. However, processing high-resolution inputs comes with high computation costs, and naive down-sampling of the input to reduce the computation costs quickly degrades the detection performance. In this paper, we propose SALISA, a novel non-uniform SALiency-based Input SAmpling technique for video object detection that allows for heavy down-sampling of unimportant background regions while preserving the fine-grained details of a high-resolution image. The resulting image is spatially smaller, leading to reduced computational costs while enabling a performance comparable to a high-resolution input. To achieve this, we propose a differentiable resampling module based on a thin plate spline spatial transformer network (TPS-STN). This module is regularized by a novel loss to provide an explicit supervision signal to learn to "magnify" salient regions. We report state-of-the-art results in the low compute regime on the ImageNet-VID and UA-DETRAC video object detection datasets. We demonstrate that on both datasets, the mAP of an EfficientDet-D1 (EfficientDet-D2) gets on par with EfficientDet-D2 (EfficientDet-D3) at a much lower computational cost. We also show that SALISA significantly improves the detection of small objects. In particular, SALISA with an EfficientDet-D1 detector improves the detection of small objects by $77\%$, and remarkably also outperforms EfficientDetD3 baseline.

연구 동기 및 목표

  • 비디오 객체 검출에서 고해상도 프레임 처리에 따른 높은 계산 비용을 해결한다.
  • 고해상도 입력을 단순히 다운샘플링할 경우 발생하는 성능 저하 문제를 해결한다.
  • 자원이 제한된 장치에서도 소형 또는 중형 객체의 정확도를 희생시키지 않고 효율적인 검출을 가능하게 한다.
  • 명시적 감독을 통해 주목도 영역에 집중하는, 유연하고 왜곡 없는 재샘플링 메커니즘을 개발한다.
  • 기본 비디오 객체 검출 벤치마크에서 저계산 비용 환경에서의 SOTA 성능을 달성한다.

제안 방법

  • 첫 번째 프레임에서 고해상도 검출 모델을 사용하여 중요한 영역을 나타내는 주목도 맵을 생성한다.
  • 미분 가능한 두꺼운 판 스퍼링 공간 변환 네트워크(TPS-STN)를 적용하여 주목도 유도 공간 변환에 기반해 현재 프레임을 왜곡하고 재샘플링한다.
  • TPS-STN가 비모수적 주의 기반 샘플러를 모방하도록 유도하는 새로운 정규화 손실을 도입하여 주목도 영역의 세부 정보 유지 보장을 확보한다.
  • TPS 샘플링 격자와 주의 기반 격자 사이의 가중치가 부여된 ℓ₂ 손실을 사용하여 주목도 콘텐츠를 확대하는 데 명시적 감독을 제공한다.
  • 비균일하게 입력을 다운샘플링한다 — 배경의 해상도는 극적으로 감소시키면서도 주목도 영역의 해상도는 유지한다.
  • 결과적으로 공간적으로 작고 세부 정보를 유지하는 이미지를 경량 검출기(예: EfficientDet-D1)에 입력하여 FLOPs를 줄이면서도 성능을 유지한다.

실험 결과

연구 질문

  • RQ1비균일하고 주목도 기반의 입력 재샘플링은 비디오 객체 검출에서 계산 비용을 줄이면서도 높은 검출 정확도를 달성할 수 있는가?
  • RQ2왜곡 없이 세밀한 세부 정보를 주목도 영역에 유지하는 동시에 아티팩트를 유발하지 않는, 유연한 재샘플링 모듈을 어떻게 훈련시킬 수 있는가?
  • RQ3주목도 기반 입력 샘플링을 사용할 경우, 경량 검출기(예: EfficientDet-D1)가 무거운 검출기(예: EfficientDet-D2 또는 D3)의 성능을 어느 정도 따라올 수 있는가?
  • RQ4제안된 방법은 일반적으로 단순 다운샘플링 과정에서 사라지기 쉬운 소형 객체의 검출을 향상시키는가?
  • RQ5TPS 변환에서 제어점의 수가 재샘플링된 입력의 품질과 견고성에 어떤 영향을 미치는가?

주요 결과

  • SALISA는 EfficientDet-D1 백본을 사용함으로써 UA-DETRAC에서 EfficientDet-D2 수준의 mAP 성능을 달성하며, FLOPs를 크게 줄였다.
  • UA-DETRAC에서 SALISA를 사용한 EfficientDet-D1은 기준선인 EfficientDet-D1 대비 소형 객체 검출 성능을 77% 향상시켰다.
  • SALISA는 UA-DETRAC에서 EfficientDet-D3 기준선을 초월하여 성능을 높였으며, 이는 모델 스케일링을 넘어서는 성능 향상을 가능하게 함을 보여준다.
  • 영역 임계값 α를 2.0에서 0.5로 조정함으로써 소형 객체의 mAP가 13.1%에서 14.9%로 상승하여 소형 객체에 대한 집중도 향상을 입증했다.
  • TPS에 1024개의 제어점을 사용할 경우, EfficientDet-D1의 mAP가 59.1%에서 49.5%로 감소하여 과도한 유연성은 성능 저하를 유발함을 보여주었다.
  • 더 무거운 关键프레임 검출기(예: D3)와 더 가벼운 메인 검출기(예: D0)를 조합해도 FLOPs가 42% 증가했음에도 mAP는 0.3% 뿐 향상되어 수익 감소 현상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.