Skip to main content
QUICK REVIEW

[논문 리뷰] SFU-HW-Tracks-v1: Object Tracking Dataset on Raw Video Sequences

Takehiro Tanaka, Hyomin Choi|arXiv (Cornell University)|2021. 12. 30.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

이 논문은 압축되지 않은 HEVC Common Test Condition 영상 시퀀스 기반으로, 13개의 시퀀스에 대해 프레임별 고유 객체 ID가 할당된 객체 추적 데이터셋인 SFU-HW-Tracks-v1을 소개한다. 이 데이터셋은 SFU-HW-Objects-v1을 확장하여 정체성 유지 가능한 주석을 제공함으로써 비디오 객체 추적 모델의 훈련 및 평가를 가능하게 하며, 정규화 상호상관관계와 수동 검증을 조합한 준자동화된 방법을 사용한다.

ABSTRACT

We present a dataset that contains object annotations with unique object identities (IDs) for the High Efficiency Video Coding (HEVC) v1 Common Test Conditions (CTC) sequences. Ground-truth annotations for 13 sequences were prepared and released as the dataset called SFU-HW-Tracks-v1. For each video frame, ground truth annotations include object class ID, object ID, and bounding box location and its dimensions. The dataset can be used to evaluate object tracking performance on uncompressed video sequences and study the relationship between video compression and object tracking.

연구 동기 및 목표

  • 압축되지 않은 영상 시퀀스에서 정체성 해석 주석이 제공되는 공개 가능하고 고품질의 데이터셋이 부족한 문제를 해결하기 위해.
  • 기존의 SFU-HW-Objects-v1 데이터셋을 고유 객체 식별자(ID)로 확장하여 비디오 객체 추적 모델의 훈련 및 평가를 가능하게 하기 위해.
  • 원본 영상 시퀀스에 대한 지상 진실 주석을 제공하여 영상 압축이 객체 추적 성능에 미치는 영향을 연구하기 위해.
  • 영상 코딩을 위한 기계용 표준화 노력(VCM)을 지원하기 위해 작업 특화의 고해상도 데이터셋을 제공하기 위해.
  • 외관 유사도와 수동 검증을 조합한 재현 가능한 준자동화된 파이프라인을 통해 영상 프레임 간 일관된 객체 정체성 할당을 구현하기 위해.

제안 방법

  • 데이터셋은 SFU-HW-Objects-v1을 기반으로 하며, 이는 클래스 레이블과 바운딩 박스를 제공하는 바탕으로, 각 객체와 프레임에 고유한 객체 ID를 추가하여 구성되었다.
  • 프레임 간 객체 ID 할당은 연속된 프레임의 바운딩 박수 간 유사도를 측정하기 위해 정규화 상호상관관계(NCC)를 사용하였다.
  • 프레임 n의 각 객체에 대해, 프레임 n+1에서 가장 높은 NCC 점수를 기록한 객체가 최적 매칭으로 선택되었으며, 유효한 매칭 여부를 판단하기 위해 임계값 0.6(가변 범위 0.55에서 0.75)를 설정하였다.
  • NCC 점수가 임계값 이하일 경우, Yolo_mark를 사용한 주석 시각화를 통해 시각적 검토를 거쳐 수동으로 새로운 ID가 할당되었다.
  • 처음으로 등장하거나 가림으로 인해 재등장하는 객체는 새로운 ID가 할당되었으며, 이러한 경우 NCC 점수는 이전 매칭이 없음을 나타내기 위해 -1로 설정되었다.
  • 주석 처리 과정은 프레임 단위로 진행되는 준자동화된 워크플로우를 따르며, 시퀀스 전반에 걸쳐 일관된 객체 정체성 추적을 보장하였다.

실험 결과

연구 질문

  • RQ1정체성 해석 주석이 있는 원본 압축되지 않은 영상 시퀀스에서 객체 추적 성능을 어떻게 평가할 수 있는가?
  • RQ2영상 압축은 객체 추적 정확도에 어느 정도 영향을 미치며, 원본 영상에 대한 지상 진실 주석이 있는 데이터셋을 통해 이를 어떻게 연구할 수 있는가?
  • RQ3외관 유사도와 수동 검증을 조합한 준자동화된 방법이 영상 프레임 간 신뢰성 있고 일관된 객체 ID 할당을 가능하게 하는가?
  • RQ4객체 외관 변화와 가림이 추적 성능에 미치는 영향은 무엇이며, 이를 벤치마크 데이터셋에서 어떻게 모델링할 수 있는가?
  • RQ5고유 객체 ID가 포함된 데이터셋이 클래스 레이블만 포함된 데이터셋과 비교해 비디오 객체 추적 모델의 훈련 및 테스트 가능성에 어떤 영향을 미치는가?

주요 결과

  • SFU-HW-Tracks-v1 데이터셋은 13개의 HEVC CTC 영상 시퀀스에 대해 지상 진실 주석을 포함하며, 각 프레임에 객체 클래스 ID, 고유 객체 ID, 정규화된 바운딩 박스 좌표(x, y, w, h)가 포함되어 있다.
  • 이 데이터셋은 이전의 SFU-HW-Objects-v1 데이터셋에서 객체 정체성이 누락되어 있어 불가능했던 비디오 객체 추적 모델의 훈련 및 평가를 가능하게 한다.
  • 준자동화된 주석 파이프라인은 NCC 기반 매칭(임계값 0.6)과 수동 보정을 통해 일관된 객체 ID 할당을 달성하였으며, 프레임 간 정체성 연속성을 보장하였다.
  • 외관 유사도가 높을 경우 객체 ID는 프레임 간 유지되었고, 객체가 등장하거나 가림 후 재등장할 경우 새로운 ID가 할당되었다.
  • 이 데이터셋은 https://doi.org/10.17632/d5cc83ks6c 에서 공개되어 있으며, 재현 가능한 연구와 영상 코딩을 위한 기계용(VCM) 표준화를 지원한다.
  • 각 시퀀스에는 4~6개의 객체 클래스가 포함되어 있으며, 클래스 ID는 COCO 객체 카테고리에 매핑되어 있으며, 운동, 가림, 스케일 변화와 같은 다양한 추적 시나리오를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.