Skip to main content
QUICK REVIEW

[논문 리뷰] A Compressive Sensing Video dataset using Pixel-wise coded exposure

Sathyaprakash Narayanan, Yeshwanth Bethi|arXiv (Cornell University)|2019. 05. 24.
Sparse and Compressive Sensing Techniques참고 문헌 9인용 수 4
한 줄 요약

이 논문은 압축 감지에서 픽셀 단위의 코딩 노출을 통해 압축된 첫 번째 종합적인 비디오 데이터셋을 소개한다. 이는 물체 추적 및 국소화를 유지하면서 비디오 데이터의 효율적 저장 및 처리를 가능하게 한다. 희박성과 비일관성 원리를 활용해 K개의 프레임을 단일 압축 프레임으로 통합함으로써, 압축된 데이터에서 직접 물체 검출, 추적, 재구성에 이르는 종단 간 연구를 지원한다. 인간 레이블링 최소화를 위해 YOLO 기반의 가짜 레이블링을 활용한다.

ABSTRACT

Manifold amount of video data gets generated every minute as we read this document, ranging from surveillance to broadcasting purposes. There are two roadblocks that restrain us from using this data as such, first being the storage which restricts us from only storing the information based on the hardware constraints. Secondly, the computation required to process this data is highly expensive which makes it infeasible to work on them. Compressive sensing(CS)[2] is a signal process technique[11], through optimization, the sparsity of a signal can be exploited to recover it from far fewer samples than required by the Shannon-Nyquist sampling theorem. There are two conditions under which recovery is possible. The first one is sparsity which requires the signal to be sparse in some domain. The second one is incoherence which is applied through the isometric property which is sufficient for sparse signals[9][10]. To sustain these characteristics, preserving all attributes in the uncompressed domain would help any kind of in this field. However, existing dataset fallback in terms of continuous tracking of all the object present in the scene, very few video datasets have comprehensive continuous tracking of objects. To address these problems collectively, in this work we propose a new comprehensive video dataset, where the data is compressed using pixel-wise coded exposure [3] that resolves various other impediments.

연구 동기 및 목표

  • 고비용의 저장 및 계산 자원으로 인해 증가하는 대규모 비디오 데이터 저장 및 처리 문제를 해결하기 위해.
  • 기존 비디오 데이터셋이 장면 내 모든 물체에 대한 연속적인 물체 추적과 종합적인 레이블링을 제공하지 못하는 한계를 극복하기 위해.
  • 압축 감지에 대한 새로운 벤치마크 데이터셋을 만들기 위해, 전체 재구성 없이도 압축 프레임에서 직접 처리가 가능한 환경을 제공하기 위해.
  • 불법 사용자가 콘텐츠를 파악할 수 없도록 하면서도 운동 정보를 내장함으로써 프라이버시를 보호하는 비디오 분석을 가능하게 하기 위해.
  • 압축 감지를 활용한 저복잡도, 고효율 비디오 처리 분야의 향후 연구 기반을 마련하기 위해.

제안 방법

  • 단일 물체(사람 및 차량)의 회색조 비디오를 다양한 운동 조건에서 촬영함: 정적 물체에 배경이 움직이는 경우, 움직이는 물체에 배경이 정적인 경우, 둘 다 움직이는 경우.
  • 신호의 희박성과 비일관성을 활용하여 픽셀 단위의 코딩 노출을 사용해 K개의 연속 프레임을 단일 압축 프레임으로 압축함.
  • 각 프레임에 대한 초기 바운딩 박스를 생성하기 위해 사전 학습된 YOLO v3 모델을 사용하며, 이를 최소/최대 좌표 풀링을 통해 압축 도메인에서 더 큰 바운딩 박스로 통합함.
  • 인간 레이블링 작업을 줄이기 위해 가짜 레이블링을 활용함: YOLO가 생성한 박스는 VATIC에서 수동으로 보정되어 압축 프레임에 대한 고품질의 진짜 레이블을 생성함.
  • 배열 저장을 효율적으로 하기 위해 NPZ 형식으로, 구조화된 레이블 메타데이터(클래스 ID, 프레임 번호, 바운딩 박스 좌표 등)는 JSON 형식으로 저장함.
  • 데이터셋에는 총 약 90분 분량의 영상이 포함된 284개의 차량 클립과 91개의 사람 클립이 있으며, 다양한 종횡비와 운동 역학을 포함함.

실험 결과

연구 질문

  • RQ1픽셀 단위의 코딩 노출을 통해 압축된 비디오 데이터셋이 전체 재구성 없이도 정확한 물체 검출 및 추적을 지원할 수 있는가?
  • RQ2압축 감지 도메인에서 YOLO v3를 활용한 가짜 레이블링이 진짜 레이블 생성에 얼마나 효과적인가?
  • RQ3픽셀 단위의 코딩 노출이 압축 프레임에서 물체 국소화에 필요한 공간적 및 시간적 정보를 어느 정도 유지하는가?
  • RQ4압축 감지 기반의 비디오 데이터셋이 계산 및 저장 비용을 줄이면서도 추적 및 인식과 같은 후속 작업에 대한 유효성을 유지할 수 있는가?
  • RQ5다양한 운동 패턴(물체 및 배경의 이동)이 직접 압축 프레임에서 작동하는 알고리즘의 성능에 어떤 영향을 미치는가?

주요 결과

  • 데이터셋은 총 약 90분 분량의 회색조 비디오로 구성되어 있으며, 다양한 운동 역학과 종횡비를 포함한 284개의 차량 클립과 91개의 사람 클립을 포함한다.
  • YOLO v3를 활용한 가짜 레이블링은 인간 레이블링 작업을 크게 줄였으며, VATIC에서의 인간 검증을 통해 바운딩 박스의 조밀함을 향상시키고 놓친 물체를 탐지하는 데 기여했다.
  • K개의 프레임에서 생성된 바운딩 박스를 압축 프레임 내 하나의 더 큰 박스로 통합함으로써, CS 도메인에서 일관된 국소화 및 추적을 가능하게 하였다.
  • 픽셀 단위의 코딩 노출을 사용함으로써 K배의 압축률을 달성하여 저장 및 처리 요구량을 K배로 줄였으며, 同시에 운동 및 물체의 구조를 유지하였다.
  • 이 데이터셋은 압축 감지에 특화된 첫 번째 데이터셋이며, 저복잡도, 프라이버시 보장형 비디오 분석 연구의 기반을 제공한다.
  • 향후 버전에서는 더 높은 압축률, 더 높은 밀도의 영상, 세그멘테이션 및 자세 추정과 같은 추가 레이블링을 포함할 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.