Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Short and Long-Term Tracking with Graph Hierarchies

Orcun Cetintas, Guillem Brasó|arXiv (Cornell University)|2022. 12. 06.
Video Surveillance and Tracking Methods인용 수 7
한 줄 요약

SUSHI는 작업에 특화된 설계 없이 짧은 시간과 긴 시간의 추적을 동시에 처리할 수 있도록 고안된 통합적이고 확장 가능한 다중 객체 추적 프레임워크를 제안한다. 단일 학습 가능한 GNN 아키텍처를 사용해 다단계 그래프 계층을 통해 영상을 처리함으로써, SUSHI는 다양한 벤치마크에서 최신 기술 수준을 달성하며, DanceTrack에서 최대 +9.5의 IDF1 향상과 MOT20에서 +9.1의 IDF1 향상을 기록한다.

ABSTRACT

Tracking objects over long videos effectively means solving a spectrum of problems, from short-term association for un-occluded objects to long-term association for objects that are occluded and then reappear in the scene. Methods tackling these two tasks are often disjoint and crafted for specific scenarios, and top-performing approaches are often a mix of techniques, which yields engineering-heavy solutions that lack generality. In this work, we question the need for hybrid approaches and introduce SUSHI, a unified and scalable multi-object tracker. Our approach processes long clips by splitting them into a hierarchy of subclips, which enables high scalability. We leverage graph neural networks to process all levels of the hierarchy, which makes our model unified across temporal scales and highly general. As a result, we obtain significant improvements over state-of-the-art on four diverse datasets. Our code and models are available at bit.ly/sushi-mot.

연구 동기 및 목표

  • 짧은 시간과 긴 시간 추적 방법을 별도로 조합하는 하이브리드 다중 수준 추적기의 한계를 해결하기 위해, 작업에 특화된 설계가 많고 일반화 능력이 떨어지는 기존 접근 방식을 개선한다.
  • 장시간 영상 추적에서의 확장성 문제를 해결하기 위해, 계층적 하위클립 분해를 통해 큰 시간 간격을 효율적으로 처리할 수 있도록 한다.
  • 최적의 신호(예: 운동성 vs. 외관)에 대한 가정을 제거하기 위해, 데이터 기반 방식으로 다양한 시간 스케일에서 작업에 적합한 특징을 학습할 수 있도록 한다.
  • 단일 공유 GNN 아키텍처를 사용해 그래프 계층의 여러 수준에서 짧은 시간과 긴 시간 추적을 통합한다.
  • 오염, 낮은 프레임 레이트, 다중 클래스 추적 등 다양한 도전 과제를 포함한 다양한 데이터셋 간의 일반화 능력을 입증한다.

제안 방법

  • 장시간 영상 클립을 하위클립의 계층적 구조로 분할하여, 하위 수준은 짧은 시간의 관계에 집중하고, 상위 수준은 점점 더 긴 시간 범위를 다룬다.
  • 각 계층 수준에서 검출 결과를 그래프의 노드로 표현하며, 운동성, 외관, 공간적 근접도 특징을 기반으로 간선을 설정한다.
  • 모든 수준에서 동일한 그래프 신경망(GNN) 아키텍처를 적용하여 관계를 처리하고 점점 더 긴 트랙릿을 생성한다.
  • 하위 수준의 트랙릿 수준 특징을 상위 수준 그래프의 입력으로 사용하여 시간 스케일 전반에 걸쳐 궤적을 계층적으로 개선한다.
  • 궤적 일관성과 정체성 유지 최적화를 위해, 미분 가능한 손실 함수를 사용해 전체 시스템을 종단 간(end-to-end)으로 학습한다.
  • 단일 그래프를 피하기 위해, 하위클립을 별도로 처리하고 계층을 통해 결과를 융합함으로써 확장성을 확보한다.
Figure 2 : SUSHI consists of a set of SUSHI blocks operating hierarchically over a set of tracklets (with initial length one) in a video clip. Each SUSHI block considers a graph with tracklets from a subclip as nodes, performs neural message passing over it, and merges nodes into longer tracks. Over
Figure 2 : SUSHI consists of a set of SUSHI blocks operating hierarchically over a set of tracklets (with initial length one) in a video clip. Each SUSHI block considers a graph with tracklets from a subclip as nodes, performs neural message passing over it, and merges nodes into longer tracks. Over

실험 결과

연구 질문

  • RQ1작업에 특화된 설계 없이도 단일 통합 모델이 짧은 시간과 긴 시간 추적을 효과적으로 처리할 수 있는가?
  • RQ2모노리식 그래프나 하이브리드 추적기 아키텍처에 비해 계층적 그래프 기반 접근 방식이 장시간 영상 추적에서 확장성 면에서 향상되는가?
  • RQ3다양한 시간 스케일에서 공유된 GNN 아키텍처가 데이터 기반 방식으로 가장 적합한 신호(예: 운동성 대비 외관)를 자동으로 학습할 수 있는가?
  • RQ4기존 하이브리드 추적기 대비 계층적 그래프 구조는 다양한 벤치마크에서 정체성 유지 및 내성성 면에서 어떻게 성능을 발휘하는가?
  • RQ5오염, 낮은 프레임 레이트, 다중 클래스 추적 등 다양한 과제를 포함한 다양한 데이터셋 간에 통합 프레임워크의 일반화 능력은 어느 정도인가?

주요 결과

  • DanceTrack 벤치마크에서 SUSHI는 최신 기술 수준 대비 +9.5의 IDF1 향상을 기록하며, 높은 오염율이 있는 도전적인 상황에서도 강력한 일반화 능력을 입증한다.
  • MOT20에서 SUSHI는 개인 세트에서 79.8의 IDF1과 64.3의 HOTA를 기록하며, 이전 최신 기술 수준 대비 +4.6의 IDF1과 +3.0의 HOTA를 확보했고, ID 스위치 수를 감소시켰다.
  • MOT17에서 SUSHI는 이전 최신 기술 수준 대비 IDF1을 +4.7 향상시켜 표준 벤치마크에서 일관된 성능 향상을 보였다.
  • BDD에서 SUSHI는 76.2의 IDF1과 69.2의 MOTA를 기록하며, 이는 단일 GNN을 모든 객체 클래스에 적용함에도 불구하고 이전 방법 대비 +4.2의 mIDF1과 +4.9의 IDF1 향상을 기록했다.
  • 계층적 설계 덕분에 장시간 클립을 효율적으로 처리할 수 있었으며, SUSHI는 단일 그래프 기반 추적기 대비 추론 시간과 메모리 사용량을 줄였다.
  • 제거 실험 결과, 다양한 스케일에서의 통합 아키텍처와 계층적 구조가 성능 향상에 필수적임을 확인했으며, 각 구성 요소가 정체성 유지에 크게 기여했다.
Figure 3 : Our hierarchy is based on recursive partitioning of the video clip and we only allow edges within these partitions. After each level, we merge tracklets belonging to the same identity and consider edges spanning across longer timespans.
Figure 3 : Our hierarchy is based on recursive partitioning of the video clip and we only allow edges within these partitions. After each level, we merge tracklets belonging to the same identity and consider edges spanning across longer timespans.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.